VLM 鲁棒性 语义干扰 推理评估 Distract-Bench
摘要

推理视觉 - 语言模型(VLM)在复杂多模态任务中表现优异,但现实应用需应对杂乱的视觉输入。现有工作多评估噪声等感知退化带来的可靠性问题,却忽视了模型正确感知却被无关但合理的视觉线索误导这一关键失败模式。为此,本文提出 Distract-Bench 基准,专门评估 VLM 对“语义视觉干扰”的鲁棒性。实验表明,此类干扰会进入推理过程并被误作证据,导致推理 VLM 表现出distinct于感知退化的脆弱性,亟需重构评估范式。

AI 推荐理由

论文核心研究推理 VLM 在语义干扰下的鲁棒性,直接探讨推理过程中的证据处理与错误传播机制。

研究机构
University of Manchester
论文信息
作者 Yizheng Sun, Mochuan Zhan, Yanan Ma, Jia Tong See, Yifan Wang et al.
发布日期 2026-06-08
arXiv ID 2606.08894
相关性评分 9/10 (高度相关)