Tool Use Reinforcement Learning Multimodal Agents Policy Optimization
摘要

视觉语言模型虽具备扩展推理能力,但许多现实问题需依赖外部工具,而单纯内部推理往往无法解决。这种“思考 - 行动”的结构性不对称导致了“思考 - 行动差距”。针对标准强化学习训练中工具使用率低及成功率差的问题,本文提出智能体探索性策略优化(AXPO)。该方法通过固定思考前缀并重采样工具调用及其后续内容,结合基于不确定性的前缀选择,显著提升了工具使用效率。在九个多模态基准测试中,SFT+AXPO 优于 SFT+GRPO,且 8B 模型性能超越 32B 基座模型。

AI 推荐理由

论文核心解决多模态智能体中工具使用频率低且效果差的问题,提出优化策略以提升技能调用能力。

研究机构
NVIDIA KAIST
论文信息
作者 Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov et al.
发布日期 2026-05-27
arXiv ID 2605.28774
相关性评分 9/10 (高度相关)