摘要
多模态大语言模型正从被动观察者演变为通过视觉扩展和知识扩展解决问题的主动 Agent。针对现有评估缺乏灵活工具集成及过程验证的不足,本文提出 Agentic-MME,一个用于评估多模态 Agent 能力的过程验证基准。该基准涵盖 6 个领域的 418 项真实任务,包含超 2000 个逐步检查点,支持沙盒代码与 API 的统一评估框架。通过审计细粒度中间状态而非仅最终答案,并引入相对于人类轨迹的“过度思考”指标量化效率,实验揭示了当前模型在复杂多模态代理问题解决上的显著差距。
AI 推荐理由
论文核心评估多模态 Agent 调用视觉工具和搜索工具的能力,属于技能学习与工具使用范畴。
研究机构
CASIA
UCAS
NJU
PKU
BUAA
NTU
UCLA
论文信息