摘要
推理已成为大语言模型的关键能力,但将基于语言的自改进技术扩展至视觉语言模型(VLM)时,面临视觉幻觉难以验证的挑战。本文提出视觉对比自教推理器(VC-STaR),利用视觉对比对(即视觉相似且问题同义的图像对)来减轻模型生成理由中的幻觉。通过构建 VisCoR-55K 数据集并进行监督微调,该方法显著提升了多种 VLM 的推理性能,实验表明其优于现有自改进方法及最先进数据集训练的模型,证明了 VLM 固有的对比能力可引导其自身视觉推理的提升。
AI 推荐理由
论文核心提出利用视觉对比机制提升 VLM 推理能力,直接解决幻觉问题。
研究机构
杭州电子科技大学
阿里巴巴云
论文信息