摘要
大型语言模型在复杂推理任务中表现优异,但并行思考策略存在推理延迟高及缺乏可靠正确性评估机制的问题。本文提出单令牌验证(OTV)方法,通过可学习令牌和低秩适配集成至模型,利用键值缓存探测内部信号,在生成过程中单次前向传播即可估计推理正确性。实验表明,OTV 在数学推理基准上优于现有验证器,并通过正确性引导的早期终止减少高达 90% 的令牌消耗,优先选择更短且可靠的解。
AI 推荐理由
论文核心提出单令牌验证机制,直接评估推理正确性,显著提升数学推理效率与准确率。
研究机构
清华大学
论文信息