Vision-Language Models Perception-Reasoning Decoupling Staged Training Reinforcement Learning
摘要

近期视觉 - 语言模型(VLM)强调长思维链推理,但本文发现其性能瓶颈主要在于视觉感知而非推理本身。研究通过将能力分解为视觉感知、视觉推理和文本推理三个阶段,系统探讨了感知与推理的相互作用。实验表明,视觉感知需专用数据优化,且作为基础支架应在推理细化前巩固;强化学习比基于标题的监督微调更有效。该方法在多个 VLM 上验证,不仅提升了感知与推理性能,还以缩短 20.8% 的推理轨迹实现了 1.5% 的准确率提升,证明优质感知可减少过度推理需求。

AI 推荐理由

论文核心研究视觉 - 语言模型中感知与推理的解耦,通过分阶段训练显著提升推理效率与准确率。

研究机构
Amazon 'UC Santa Cruz 'University of Waterloo
论文信息
作者 Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi et al.
发布日期 2026-05-19
arXiv ID 2605.20177
相关性评分 9/10 (高度相关)