Omni-modal Tool Use Agent Benchmark Multi-modal Reasoning
摘要

人类智能自然融合了涵盖视觉、音频和语言的全模态感知与复杂推理及工具使用。针对当前多模态大模型局限于双模态交互的问题,本文提出了 OmniGAIA 基准,用于评估智能体在视频、音频和图像模态下的深度推理与多轮工具执行能力。此外,文章提出了 OmniAtlas,一种基于工具集成推理范式的原生全模态基础智能体。通过事后引导树探索策略合成的轨迹及 OmniDPO 进行细粒度纠错训练,OmniAtlas 有效增强了开源模型的工具使用能力,推动了下一代现实场景全模态 AI 助手的发展。

AI 推荐理由

论文核心提出原生多模态智能体 OmniAtlas,重点在于工具集成推理范式及提升现有模型的工具使用能力。

研究机构
复旦大学 小红书公司 东南大学 浙江大学 清华大学
论文信息
作者 Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Shijian Wang, Guanting Dong et al.
发布日期 2026-02-26
arXiv ID 2602.22897
相关性评分 9/10 (高度相关)