摘要
针对多模态大模型在复杂多步推理及视觉证据与外部知识整合方面的局限,本文提出 MTA-Agent。该智能体能自动选择工具检索并验证多源证据,生成结构化多跳问答轨迹。基于此构建的 MTA-Vision-DeepSearch 数据集包含 2.1 万高质量样本。实验表明,经该数据训练的 32B 开源智能体在六个基准测试中平均得分 54.63%,超越 GPT-5 等闭源模型。训练显著增加了推理步数,优化了搜索策略,并支持通过回放缓存交互降低训练成本。
AI 推荐理由
论文核心解决多模态多步推理难题,通过数据增强显著提升推理深度与证据整合能力。
研究机构
Salesforce AI Research
论文信息