摘要
针对搜索查询的多跳特性及网络结果的多模态异构冲突问题,本文提出 MERRIN 基准,用于评估搜索增强型智能体。该基准要求智能体在无明确模态提示下识别相关模态、检索多模态证据并执行多跳推理。实验涵盖十种模型及三种搜索设置,结果显示现有智能体表现欠佳,平均准确率仅 22.3%。强模型虽步骤更多,但常受冲突内容干扰且过度依赖文本,导致资源消耗大却准确率低。研究凸显了开发鲁棒多模态搜索推理智能体的必要性。
AI 推荐理由
论文核心评估智能体在噪声环境下进行多跳推理及多模态证据整合的能力。
研究机构
UNC Chapel Hill
Virginia Tech
University of Texas at Austin
论文信息