Vision-Language Models Reinforcement Learning Credit Assignment Perception-Reasoning Synergy
摘要

实现鲁棒的感知 - 推理协同是先进视觉语言模型(VLM)的核心目标。现有方法常受限于静态文本推理或外部代理的复杂性,导致性能提升不成比例。本文指出根本瓶颈在于模态信用分配的模糊性:无法区分失败源于感知错误还是逻辑缺陷。为此,我们提出一种强化学习框架,通过将生成过程分解为交错的感知与推理步骤,并引入“盲推理”代理进行感知验证,独立奖励感知保真度。结合结构化语言验证算法,该机制能精准定位错误源,显著提升 VLM 在广泛任务中的综合表现。

AI 推荐理由

论文核心解决视觉语言模型中感知与推理的协同问题,提出模态信用分配机制以增强推理能力。

研究机构
Hong Kong University of Science and Technology (HKUST) Tsinghua University University of Waterloo
论文信息
作者 Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng et al.
发布日期 2026-05-13
arXiv ID 2605.14054
相关性评分 9/10 (高度相关)