推理验证 高效解码 数学推理 早期终止
摘要

大型语言模型在复杂推理任务中表现优异,但并行思考策略存在推理延迟高及缺乏可靠正确性评估机制的问题。本文提出单令牌验证(OTV)方法,通过可学习令牌和低秩适配集成至模型,利用键值缓存探测内部信号,在生成过程中单次前向传播即可估计推理正确性。实验表明,OTV 在数学推理基准上优于现有验证器,并通过正确性引导的早期终止减少高达 90% 的令牌消耗,优先选择更短且可靠的解。

AI 推荐理由

论文核心提出单令牌验证机制,直接评估推理正确性,显著提升数学推理效率与准确率。

研究机构
清华大学
论文信息
作者 Zhan Zhuang, Xiequn Wang, Zebin Chen, Feiyang Ye, Ying Wei et al.
发布日期 2026-03-01
arXiv ID 2603.01025
相关性评分 9/10 (高度相关)