摘要
当前视觉语言模型在多视图空间推理方面仍面临挑战,常因依赖单图捷径而忽视跨视图关系。本文提出 ViewFusion,一种两阶段框架,将跨视图空间预对齐与问答明确分离。第一阶段通过深思熟虑的空间预思考推断视图间关系及变换,构建中间工作区;第二阶段基于该工作区进行问题驱动的推理以生成最终预测。采用合成推理监督结合 GRPO 强化学习训练,在 MMSI-Bench 上准确率提升 5.3%,尤其在需真实跨视图对齐的任务中表现优异。
AI 推荐理由
论文提出结构化空间思维链,核心解决多视图推理难题,显著提升推理能力。
研究机构
HKUST(GZ)
HKUST
UC Merced
University of Queensland
论文信息