摘要
实现鲁棒的感知 - 推理协同是先进视觉语言模型(VLM)的核心目标。现有方法常受限于静态文本推理或外部代理的复杂性,导致性能提升不成比例。本文指出根本瓶颈在于模态信用分配的模糊性:无法区分失败源于感知错误还是逻辑缺陷。为此,我们提出一种强化学习框架,通过将生成过程分解为交错的感知与推理步骤,并引入“盲推理”代理进行感知验证,独立奖励感知保真度。结合结构化语言验证算法,该机制能精准定位错误源,显著提升 VLM 在广泛任务中的综合表现。
AI 推荐理由
论文核心解决视觉语言模型中感知与推理的协同问题,提出模态信用分配机制以增强推理能力。
研究机构
Hong Kong University of Science and Technology (HKUST)
Tsinghua University
University of Waterloo
论文信息