Multimodal Agent Tool Use Benchmark Process Verification
摘要

多模态大语言模型正从被动观察者演变为通过视觉扩展和知识扩展解决问题的主动 Agent。针对现有评估缺乏灵活工具集成及过程验证的不足,本文提出 Agentic-MME,一个用于评估多模态 Agent 能力的过程验证基准。该基准涵盖 6 个领域的 418 项真实任务,包含超 2000 个逐步检查点,支持沙盒代码与 API 的统一评估框架。通过审计细粒度中间状态而非仅最终答案,并引入相对于人类轨迹的“过度思考”指标量化效率,实验揭示了当前模型在复杂多模态代理问题解决上的显著差距。

AI 推荐理由

论文核心评估多模态 Agent 调用视觉工具和搜索工具的能力,属于技能学习与工具使用范畴。

研究机构
CASIA UCAS NJU PKU BUAA NTU UCLA
论文信息
作者 Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang et al.
发布日期 2026-04-03
arXiv ID 2604.03016
相关性评分 9/10 (高度相关)