VLM Comparative Reasoning Benchmark Fine-grained Analysis
摘要

区分视觉相似图像间的细微差异对工业检测、医疗成像等领域至关重要。现有基准多关注显著差异,缺乏对细微推理的评估。本文提出 VLM-SubtleBench,涵盖属性、状态等十类细微差异,跨越工业、航空及医疗等多领域。通过对专有及开源模型的广泛评估,揭示了模型与人类在不同差异类型及领域中的系统性差距,并分析了模型推理能力急剧下降的场景,为推动 VLM 达到人类水平的比较推理奠定基础。

AI 推荐理由

论文核心聚焦于评估 VLM 在细微差异下的比较推理能力,直接针对推理机制。

研究机构
KRAFTON KAIST
论文信息
作者 Minkyu Kim, Sangheon Lee, Dongmin Park
发布日期 2026-03-09
arXiv ID 2603.07888
相关性评分 9/10 (高度相关)