Mathematical Reasoning Self-Verification Training Efficiency Dynamic Reference Model
摘要

尽管大语言模型在数学推理方面进展显著,但其判断自身解答正确性的能力仍不可靠。现有自我验证方法通常将解答生成与验证视为两个独立任务,导致训练时间大幅增加。本文提出 FABSVer,将这两项任务融合为单次生成过程,大幅降低训练开销并联合优化两种能力。此外,我们发现并解决了收敛瓶颈:随着训练进行,因策略受固定参考模型限制,奖励趋于停滞。为此,我们引入动态参考模型更新(DRMU)机制,提升奖励上限以实现持续增长。实验表明,该方法在三种模型规模下均实现了卓越的自我验证与推理性能,且训练时间仅为现有方法的 51% 至 71%。

AI 推荐理由

论文核心解决数学推理中的自我验证问题,提出融合生成与验证的新方法。

研究机构
Ziyyebang Education Technology
论文信息
作者 Haihui Pan, Junwei Bao, Hongfei Jiang, Yang Song
发布日期 2026-05-27
arXiv ID 2605.28389
相关性评分 9/10 (高度相关)