摘要
宽基线匹配(WBM)需要整合几何理解、视角变化、细粒度感知及遮挡推理,是测试多模态大模型(MLLMs)空间推理能力的挑战性问题。针对当前缺乏系统评估与训练框架的现状,本文提出了 ReasonMatch-Bench 基准,揭示了现有模型在细粒度匹配上的显著不足。为此,作者构建了可扩展的数据生成流水线,并提出动态对应强化学习(DCRL)方法,结合图像级视角进展与点级对应课程,利用可验证奖励在无显式思维链监督下提升训练效果。实验表明该方法显著提升了空间推理性能并具有良好的迁移性。
AI 推荐理由
论文核心聚焦于提升多模态大模型的空间推理能力,提出新基准与强化学习方法。
研究机构
State Key Laboratory of CAD & CG, Zhejiang University
Ant Group
Westlake University
论文信息