Token-Efficient Reinforcement Learning Information Theory Chain of Thought
摘要

大型语言模型依赖长思维链提升准确率,但带来高昂推理成本。本文重审令牌高效后训练,指出现有序列级奖励塑造方法在分配推理努力方面控制力有限。为此,提出 IAPO,一种基于信息论的后训练框架,依据每个令牌与最终答案的条件互信息分配令牌级优势。该机制能明确识别高信息量推理步骤并抑制低效用探索。理论分析表明,IAPO 可在不损害正确性的前提下单调减少推理冗余。实验显示,IAPO 在多个数据集上显著提升推理准确率并将推理长度缩短高达 36%,优于现有令牌高效强化学习方法。

AI 推荐理由

论文核心提出基于信息论的优化框架,直接针对提升推理效率与准确性,属推理领域核心研究。

研究机构
中国科学院
论文信息
作者 Yinhan He, Yaochen Zhu, Mingjia Shi, Wendy Zheng, Lin Su et al.
发布日期 2026-02-22
arXiv ID 2602.19049
相关性评分 9/10 (高度相关)