Chain-of-Thought Reinforcement Learning Reasoning Efficiency LLM Compression
摘要

大型推理模型虽凭借扩展的思维链(CoT)表现优异,但面临令牌消耗过大和推理延迟高的问题。现有压缩方法多采用静态长度惩罚,忽视了模型能力动态与问题难度差异。本文提出 ExpThink 框架,通过两种机制解决该问题:一是经验引导的奖励塑造,基于历史最短正确解自动调整奖励阈值,形成自进化课程;二是难度自适应优势计算,通过正确计数归一化放大难题梯度并抑制易题梯度。实验表明,该方法在多个数学推理基准上将平均响应长度减少高达 77%,同时提升准确率,显著优于现有基线。

AI 推荐理由

论文核心针对思维链(CoT)推理的压缩与优化,直接提升推理效率与准确率。

研究机构
百度
论文信息
作者 Tingcheng Bian, Yuzhe Zhang, Jing Jin, Jinchang Luo, MingQuan Cheng et al.
发布日期 2026-05-08
arXiv ID 2605.07501
相关性评分 9/10 (高度相关)