信用分配 强化学习 Agent 训练 多轮交互
摘要

多轮 LLM Agent 在生产系统中至关重要,但现有方法在任务难度波动时难以准确区分信号与噪声,导致信用分配错误。本文提出基于邻近度的多轮优化(ProxMO)框架,通过成功率感知调制动态调整梯度强度,并利用基于邻近度的软聚合在步骤级别生成基线。实验表明,ProxMO 在 ALFWorld 和 WebShop 基准上显著优于现有方法,且计算成本极低,可与标准 GRPO 框架无缝集成,适用于工业级训练流程。

AI 推荐理由

论文提出 ProxMO 框架优化多轮训练中的信用分配,直接提升 Agent 自我改进与适应能力。

研究机构
兰州大学 复旦大学 北京大学 清华大学 腾讯公司 上海交通大学
论文信息
作者 Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi et al.
发布日期 2026-02-22
arXiv ID 2602.19225
相关性评分 9/10 (高度相关)