Reinforcement Learning Credit Assignment Self-Distillation Mathematical Reasoning LLM Agents
摘要

强化学习常用于 LLM Agent 后训练,但依赖粗粒度的结果级奖励。本文提出 GEAR 框架,利用自蒸馏产生的 token 和片段级信号,自适应地重塑轨迹级优势。该方法通过对比学生模型与教师模型的差异,识别语义偏离点作为自适应信用区域的锚点,动态调整局部优势权重。在八个数学推理和工具使用基准测试中,GEAR 显著优于标准 GRPO 及其他基线,尤其在长程复杂任务中提升幅度达 20%。

AI 推荐理由

论文提出自适应粒度信用分配框架,显著提升数学推理与长程任务表现,核心解决推理过程中的监督稀疏问题。

研究机构
Microsoft Research Asia Hong Kong University of Science and Technology
论文信息
作者 Sijia Li, Yuchen Huang, Zifan Liu, Yanping Li, Jingjing Fu et al.
发布日期 2026-05-12
arXiv ID 2605.11853
相关性评分 9/10 (高度相关)