Multimodal Agents Tool Use Evaluation Capability Gains Ablation Study
摘要

本文质疑仅凭工具调用轨迹即断定 Agent 学会使用工具的普遍观点,指出这未必代表工具提供了关键信息。研究对比了 Thyme 和 DeepEyesV2 等多模态 Agent 与其无工具版本及纯文本推理器在现实理解、OCR 及数学推理等任务的表现。结果显示,工具访问并未带来一致的性能提升或成本降低,绝大多数工具解决的问题也可由非工具设置解决。消融实验表明,Agent 更多是学习了调用模式而非工具赋予的实际能力,建议评估应区分工具可用性与实际解题能力的扩展。

AI 推荐理由

论文核心研究多模态 Agent 的工具使用机制、有效性评估及能力增益,直接对应技能学习主题。

研究机构
中国科学院大学 阿里巴巴集团 通义实验室,阿里巴巴集团 北京大学
论文信息
作者 Garvin Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li et al.
发布日期 2026-06-01
arXiv ID 2606.02357
相关性评分 9/10 (高度相关)