摘要
现有多模态代理搜索基准将视觉证据局限于输入或终点,而非搜索轨迹的一部分。本文提出 InterLV-Search,一个用于交错式语言 - 视觉代理搜索的基准,其中文本与视觉证据被反复用于条件化后续搜索。该基准包含 2061 个样本,涵盖主动视觉证据寻求、受控离线交错搜索及开放网络交错搜索三个层级,并引入多分支比较任务。实验表明,当前系统在视觉证据寻求与多模态整合方面仍面临巨大挑战,最佳模型准确率不足 50%。
AI 推荐理由
论文聚焦多模态代理的搜索轨迹规划,涉及证据获取与多步决策,属规划核心。
研究机构
南洋理工大学
山东大学
达摩院
阿里巴巴集团
南方科技大学
论文信息