摘要
推理视觉 - 语言模型(VLM)在复杂多模态任务中表现优异,但现实应用需应对杂乱的视觉输入。现有工作多评估噪声等感知退化带来的可靠性问题,却忽视了模型正确感知却被无关但合理的视觉线索误导这一关键失败模式。为此,本文提出 Distract-Bench 基准,专门评估 VLM 对“语义视觉干扰”的鲁棒性。实验表明,此类干扰会进入推理过程并被误作证据,导致推理 VLM 表现出distinct于感知退化的脆弱性,亟需重构评估范式。
AI 推荐理由
论文核心研究推理 VLM 在语义干扰下的鲁棒性,直接探讨推理过程中的证据处理与错误传播机制。
研究机构
University of Manchester
论文信息