摘要
近期视觉 - 语言模型(VLM)强调长思维链推理,但本文发现其性能瓶颈主要在于视觉感知而非推理本身。研究通过将能力分解为视觉感知、视觉推理和文本推理三个阶段,系统探讨了感知与推理的相互作用。实验表明,视觉感知需专用数据优化,且作为基础支架应在推理细化前巩固;强化学习比基于标题的监督微调更有效。该方法在多个 VLM 上验证,不仅提升了感知与推理性能,还以缩短 20.8% 的推理轨迹实现了 1.5% 的准确率提升,证明优质感知可减少过度推理需求。
AI 推荐理由
论文核心研究视觉 - 语言模型中感知与推理的解耦,通过分阶段训练显著提升推理效率与准确率。
研究机构
Amazon 'UC Santa Cruz 'University of Waterloo
论文信息