Tool Use Multimodal Benchmark Agent Evaluation Egocentric Vision
摘要

随着 AI 智能体在开放现实环境中运行,亟需多模态感知、多跳推理工具调用及动态交互的深度融合。现有基准难以联合评估这些能力。为此,本文提出 EgoBench,首个面向工具使用智能体的交互式多模态基准。它包含 1045 个基于第一人称视频的任务,覆盖四种日常场景,并构建了用户 - 智能体 - 工具交互环境。通过三阶段协同流程,强制结合视觉感知与工具增强型多跳推理。此外,引入多智能体模拟用户以评估交互能力,并建立确定性联合验证框架确保评估客观性。实验显示当前最先进模型性能存在严重瓶颈。

AI 推荐理由

论文核心是评估智能体工具使用能力,构建多模态工具调用基准。

研究机构
Ant Group
论文信息
作者 Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing et al.
发布日期 2026-05-27
arXiv ID 2605.27820
相关性评分 9/10 (高度相关)