摘要
人类智能自然融合了涵盖视觉、音频和语言的全模态感知与复杂推理及工具使用。针对当前多模态大模型局限于双模态交互的问题,本文提出了 OmniGAIA 基准,用于评估智能体在视频、音频和图像模态下的深度推理与多轮工具执行能力。此外,文章提出了 OmniAtlas,一种基于工具集成推理范式的原生全模态基础智能体。通过事后引导树探索策略合成的轨迹及 OmniDPO 进行细粒度纠错训练,OmniAtlas 有效增强了开源模型的工具使用能力,推动了下一代现实场景全模态 AI 助手的发展。
AI 推荐理由
论文核心提出原生多模态智能体 OmniAtlas,重点在于工具集成推理范式及提升现有模型的工具使用能力。
研究机构
复旦大学
小红书公司
东南大学
浙江大学
清华大学
论文信息