多跳推理 视觉深度搜索 多模态大模型 基准测试
摘要

视觉深度搜索要求多模态大推理模型代理通过反复检查图像区域、将中间推理 grounded 于视觉证据并连接长推理链中的细粒度线索来回答复杂查询。然而,现有基准主要关注单步视觉理解或静态图像问答,缺乏对迭代图像检查、视觉锚点定位及多跳证据整合的评估。本文提出 VistaHop,一个用于评估视觉中心搜索和多跳视觉推理的基准,包含高分辨率图像、视觉搜索场景及需遵循证据链的多跳 QA 任务。实验表明当前模型在此任务上表现不佳,揭示了视觉定位和长链推理等方面的局限。

AI 推荐理由

论文核心聚焦多跳视觉推理,评估长链推理与证据整合能力。

研究机构
East China Normal University Shanghai Innovation Institute Meituan
论文信息
作者 Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su et al.
发布日期 2026-06-02
arXiv ID 2606.03273
相关性评分 9/10 (高度相关)