Chain-of-Thought Reinforcement Learning Model Compression Reasoning Efficiency
摘要

大型语言模型虽通过扩展思维链(CoT)推理实现卓越性能,但长过程导致巨大推理开销。现有压缩方法受限于手动长度预算、昂贵的多阶段训练及小模型可扩展性差。本文提出 HMPO,一种低成本单阶段强化学习框架。它通过自适应中值预算、余弦衰减令牌奖励及乘法奖励公式,有效压缩 CoT 并优先保证答案正确性。实验表明,HMPO 在 9B 至 122B 参数模型上实现了 19%-46% 的令牌压缩,且精度几乎无损失,显著降低了训练成本。

AI 推荐理由

论文核心研究思维链(CoT)推理过程的压缩与优化,直接提升推理效率。

研究机构
Li Auto Inc.
论文信息
作者 Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu et al.
发布日期 2026-06-01
arXiv ID 2606.01934
相关性评分 9/10 (高度相关)