摘要
跨视角空间推理仍是视觉语言模型的薄弱环节,因其常依赖语言推理而丢失细粒度几何信息。本文研究如何在统一多模态模型中有效利用“视觉思维”,即生成中间思考图像。我们提出“视图丢弃”训练策略,迫使模型利用思考图像而非仅依赖输入视图进行作答。进一步比较三种视觉思维变体,发现全景渲染结合视图丢弃在信息量与可学习性之间取得最佳平衡,显著提升了跨域泛化能力。
AI 推荐理由
论文核心研究跨视角空间推理,提出视觉思维机制以增强模型几何推理能力。
研究机构
Mila - Quebec AI Institute
Université de Montréal
McGill University
ServiceNow AI Research
Canada CIFAR AI Chair
论文信息