摘要
大型视觉语言模型(LVLMs)虽具备强大的多模态推理能力,但常伴随高置信度的幻觉与错误回答。现有方法通常优化单一的整体置信度,无法区分感知失败与推理错误。为此,本文提出 VL-Calibration,一种强化学习框架,将置信度显式解耦为视觉置信度与推理置信度。通过结合图像扰动下的视觉接地度量与内部令牌熵,该方法在无真实感知标签下监督视觉置信度,并利用令牌级优势重加权抑制幻觉。实验表明,该方法在多个基准上有效提升了校准效果及视觉推理准确率。
AI 推荐理由
论文核心解决多模态推理中的幻觉与置信度校准问题,直接提升推理可靠性。
研究机构
浙江大学
论文信息