摘要
视觉深度搜索要求多模态大推理模型代理通过反复检查图像区域、将中间推理 grounded 于视觉证据并连接长推理链中的细粒度线索来回答复杂查询。然而,现有基准主要关注单步视觉理解或静态图像问答,缺乏对迭代图像检查、视觉锚点定位及多跳证据整合的评估。本文提出 VistaHop,一个用于评估视觉中心搜索和多跳视觉推理的基准,包含高分辨率图像、视觉搜索场景及需遵循证据链的多跳 QA 任务。实验表明当前模型在此任务上表现不佳,揭示了视觉定位和长链推理等方面的局限。
AI 推荐理由
论文核心聚焦多跳视觉推理,评估长链推理与证据整合能力。
研究机构
East China Normal University
Shanghai Innovation Institute
Meituan
论文信息