摘要
视觉语言模型虽具备扩展推理能力,但许多现实问题需依赖外部工具,而单纯内部推理往往无法解决。这种“思考 - 行动”的结构性不对称导致了“思考 - 行动差距”。针对标准强化学习训练中工具使用率低及成功率差的问题,本文提出智能体探索性策略优化(AXPO)。该方法通过固定思考前缀并重采样工具调用及其后续内容,结合基于不确定性的前缀选择,显著提升了工具使用效率。在九个多模态基准测试中,SFT+AXPO 优于 SFT+GRPO,且 8B 模型性能超越 32B 基座模型。
AI 推荐理由
论文核心解决多模态智能体中工具使用频率低且效果差的问题,提出优化策略以提升技能调用能力。
研究机构
NVIDIA
KAIST
论文信息