摘要
思维链(CoT)提升了推理可靠性但增加了 token 成本,促使对显式推理轨迹进行后训练压缩。然而,最短充分推理并非通用,取决于难度、模型容量及训练状态,固定长度目标往往脆弱。实践中,朴素的基于 RL 的压缩可能不当缩短用户可见答案,因单一完成级学习信号泄露至思考/回答边界。本文提出难度缩放分段式 GRPO(DSS-GRPO),将回报分解为思考与回答组件,计算每段的组相对优势,并通过硬 token 掩码路由,确保压缩更新仅作用于思考部分,而答案对齐仅作用于回答部分。该方法利用提示级组内塑造和难度感知缩放,鼓励简洁推理同时避免答案行为崩塌。
AI 推荐理由
论文核心研究思维链(CoT)压缩,通过强化学习优化推理过程长度而不损失答案质量。
研究机构
电子科技大学
论文信息