摘要
大型语言模型常通过生成长推理轨迹来提升性能,但现有高效推理方法多在短上下文下后训练,导致训练不稳定且精度下降。本文提出步级优势选择(SAS)方法,在推理步级别操作,对错判轨迹中的高置信度步骤及正确轨迹中的低置信度步骤赋予零优势,以解决截断或验证器问题引发的失败。实验表明,SAS 在多种数学及通用推理基准上,相比最强长度感知基线,平均 Pass@1 准确率提升 0.86%,同时推理长度减少 16.3%,实现了更优的准确率 - 效率权衡。
AI 推荐理由
论文核心提出步级优势选择方法,旨在优化 LLM 推理过程的效率与稳定性,直接针对推理机制。
研究机构
UNC Chapel Hill
Advanced Micro Devices, Inc.
论文信息