Visual Reasoning Benchmark Ultra-Resolution Evidence Grounding VLM Evaluation
摘要

视觉语言模型在常规基准表现优异,但在关键证据微小、分散的超高分辨率图像中能力尚不明确。现有评估多关注最终答案准确率,缺乏对证据获取与整合过程的洞察。本文提出 UltraVR,一个面向超高分辨率图像的证据支撑视觉推理诊断基准,涵盖监控、遥感、病理及工业检测四大场景。该基准提供结构化思维链标注,将推理分解为证据定位、局部感知等步骤,实现过程级诊断。评估显示当前模型在证据 grounding 环节失败率高,而提供中间事实后推理能力显著恢复。

AI 推荐理由

论文核心聚焦超高分辨率图像下的证据 grounding 推理,提出诊断基准并深入分析推理链断裂点。

研究机构
University of British Columbia
论文信息
作者 Gexin Huang, Yanting Yang, Myeongkyun Kang, Beidi Zhao, Jun Zhou et al.
发布日期 2026-06-04
arXiv ID 2606.05576
相关性评分 9/10 (高度相关)