摘要
强化学习常用于 LLM Agent 后训练,但依赖粗粒度的结果级奖励。本文提出 GEAR 框架,利用自蒸馏产生的 token 和片段级信号,自适应地重塑轨迹级优势。该方法通过对比学生模型与教师模型的差异,识别语义偏离点作为自适应信用区域的锚点,动态调整局部优势权重。在八个数学推理和工具使用基准测试中,GEAR 显著优于标准 GRPO 及其他基线,尤其在长程复杂任务中提升幅度达 20%。
AI 推荐理由
论文提出自适应粒度信用分配框架,显著提升数学推理与长程任务表现,核心解决推理过程中的监督稀疏问题。
研究机构
Microsoft Research Asia
Hong Kong University of Science and Technology
论文信息