Reinforcement Learning Tool Use Credit Assignment Multimodal Agents
摘要

本文指出并形式化了 GRPO 在工具增强型多模态搜索智能体中的系统性失效模式:信用错误分配。其将轨迹级优势均匀广播至所有 token,导致失败轨迹中有价值的工具使用步骤受到不当惩罚。为此,作者提出工具感知策略优化(TAPO),利用信息获取工具的参数确定性,在训练批次内构建反事实见证,并通过置信度门控的保守优势修正来补偿错误分配的负信用。该方法无需额外标注或模型,在多个基准测试中显著提升了主流 RL 算法的性能。

AI 推荐理由

论文核心解决多模态搜索 Agent 中工具使用的信用分配问题,直接优化技能学习。

研究机构
University of Science and Technology of China Meituan
论文信息
作者 Chengqi Dong, Chuhuai Yue, Hang He, yandong liu, Fenghe Tang et al.
发布日期 2026-06-04
arXiv ID 2606.05784
相关性评分 9/10 (高度相关)