摘要
推测解码通过轻量模型生成草稿并由强模型验证来加速推理,但其以令牌为中心的特性易导致错误步骤传播。现有方法依赖外部奖励模型,增加了延迟与计算开销。本文提出 SpecGuard,一种仅利用模型内部信号进行步级验证的框架。该框架在每一步采样多个候选,利用基于注意力的接地分数和基于对数概率的置信度分数组成的集成信号,判断步骤接受或重算。实验表明,SpecGuard 在多个推理基准上准确率提升 3.6%,延迟降低约 11%。
AI 推荐理由
论文核心针对多步推理中的错误传播问题,提出步级验证机制以提升推理准确率。
研究机构
IIT Kharagpur
Adobe Research
论文信息