Chain-of-Thought Efficient Reasoning Early Exit RLHF
摘要

大型推理模型虽擅长利用长思维链解决问题,但常因冗余检查浪费算力。现有抑制“过度思考”的方法存在缺陷:训练时长度惩罚会削弱能力,而推理时早退则增加系统开销。为此,本文提出 Step-GRPO,一种将动态早退能力直接内化至模型的后训练框架。该方法利用语言标记结构化推理,将优化目标从原始令牌转向语义步骤。通过引入动态截断展开机制与步感知相对奖励,显著提升了准确率与效率的平衡。实验表明,该方法在减少 32% 令牌消耗的同时,避免了传统方法的精度下降。

AI 推荐理由

论文核心在于优化思维链推理效率,通过内部化动态早退机制解决冗余计算问题。

研究机构
East China Normal University Shanghai AI Laboratory Fudan University Rakuten Singapore
论文信息
作者 Benteng Chen, Weida Wang, Shufei Zhang, Mingbao Lin, Min Zhang
发布日期 2026-04-18
arXiv ID 2604.16890
相关性评分 9/10 (高度相关)