Visual Reasoning Self-Improvement VLM Hallucination Mitigation Contrastive Learning
摘要

推理已成为大语言模型的关键能力,但将基于语言的自改进技术扩展至视觉语言模型(VLM)时,面临视觉幻觉难以验证的挑战。本文提出视觉对比自教推理器(VC-STaR),利用视觉对比对(即视觉相似且问题同义的图像对)来减轻模型生成理由中的幻觉。通过构建 VisCoR-55K 数据集并进行监督微调,该方法显著提升了多种 VLM 的推理性能,实验表明其优于现有自改进方法及最先进数据集训练的模型,证明了 VLM 固有的对比能力可引导其自身视觉推理的提升。

AI 推荐理由

论文核心提出利用视觉对比机制提升 VLM 推理能力,直接解决幻觉问题。

研究机构
杭州电子科技大学 阿里巴巴云
论文信息
作者 Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan et al.
发布日期 2026-03-03
arXiv ID 2603.02556
相关性评分 9/10 (高度相关)