摘要
本文指出并形式化了 GRPO 在工具增强型多模态搜索智能体中的系统性失效模式:信用错误分配。其将轨迹级优势均匀广播至所有 token,导致失败轨迹中有价值的工具使用步骤受到不当惩罚。为此,作者提出工具感知策略优化(TAPO),利用信息获取工具的参数确定性,在训练批次内构建反事实见证,并通过置信度门控的保守优势修正来补偿错误分配的负信用。该方法无需额外标注或模型,在多个基准测试中显著提升了主流 RL 算法的性能。
AI 推荐理由
论文核心解决多模态搜索 Agent 中工具使用的信用分配问题,直接优化技能学习。
研究机构
University of Science and Technology of China
Meituan
论文信息