视觉思维 空间推理 多模态学习 跨视角理解
摘要

跨视角空间推理仍是视觉语言模型的薄弱环节,因其常依赖语言推理而丢失细粒度几何信息。本文研究如何在统一多模态模型中有效利用“视觉思维”,即生成中间思考图像。我们提出“视图丢弃”训练策略,迫使模型利用思考图像而非仅依赖输入视图进行作答。进一步比较三种视觉思维变体,发现全景渲染结合视图丢弃在信息量与可学习性之间取得最佳平衡,显著提升了跨域泛化能力。

AI 推荐理由

论文核心研究跨视角空间推理,提出视觉思维机制以增强模型几何推理能力。

研究机构
Mila - Quebec AI Institute Université de Montréal McGill University ServiceNow AI Research Canada CIFAR AI Chair
论文信息
作者 Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi et al.
发布日期 2026-05-26
arXiv ID 2605.27310
相关性评分 9/10 (高度相关)