摘要
多轮 LLM Agent 在生产系统中至关重要,但现有方法在任务难度波动时难以准确区分信号与噪声,导致信用分配错误。本文提出基于邻近度的多轮优化(ProxMO)框架,通过成功率感知调制动态调整梯度强度,并利用基于邻近度的软聚合在步骤级别生成基线。实验表明,ProxMO 在 ALFWorld 和 WebShop 基准上显著优于现有方法,且计算成本极低,可与标准 GRPO 框架无缝集成,适用于工业级训练流程。
AI 推荐理由
论文提出 ProxMO 框架优化多轮训练中的信用分配,直接提升 Agent 自我改进与适应能力。
研究机构
兰州大学
复旦大学
北京大学
清华大学
腾讯公司
上海交通大学
论文信息