Visual Illusions Qualitative Reasoning VLM Robustness Zero-shot Learning
摘要

尽管视觉语言模型在通用视觉任务中表现优异,但在面对光学幻觉时感知鲁棒性脆弱,常因依赖语言先验而非视觉证据导致失败。本文提出结构化定性推理(SQI),一种无需训练、以数据为中心的框架,旨在增强冻结模型的视觉 grounding。SQI 通过公理约束注入、分层场景分解和反事实自我验证三个模块,系统性地抑制量化幻觉并解耦背景干扰。实验表明,该方法在 DataCV 2026 挑战赛中获第二名,显著提升了各类幻觉任务的准确率及诊断可解释性。

AI 推荐理由

论文提出结构化定性推理框架,核心在于通过逻辑约束和对抗性推理解决视觉幻觉。

研究机构
中国科学院自动化研究所 华中科技大学 赫尔大学
论文信息
作者 Hao Guo, Fei Wang, Junjie Chen, Yiqi Nie, Jiaqi Zhao et al.
发布日期 2026-04-29
arXiv ID 2604.26250
相关性评分 9/10 (高度相关)