摘要
大型语言模型依赖长思维链提升准确率,但带来高昂推理成本。本文重审令牌高效后训练,指出现有序列级奖励塑造方法在分配推理努力方面控制力有限。为此,提出 IAPO,一种基于信息论的后训练框架,依据每个令牌与最终答案的条件互信息分配令牌级优势。该机制能明确识别高信息量推理步骤并抑制低效用探索。理论分析表明,IAPO 可在不损害正确性的前提下单调减少推理冗余。实验显示,IAPO 在多个数据集上显著提升推理准确率并将推理长度缩短高达 36%,优于现有令牌高效强化学习方法。
AI 推荐理由
论文核心提出基于信息论的优化框架,直接针对提升推理效率与准确性,属推理领域核心研究。
研究机构
中国科学院
论文信息