Spatial Reasoning Vision-Language Models Embodied AI Multi-view Learning
摘要

视觉语言模型在单视图任务中表现优异,但缺乏具身智能系统理解三维环境所需的多视角空间推理能力。本文提出跨视图关系(XVR)大规模数据集,涵盖对应、验证与定位三大空间推理任务,旨在教导模型进行多视角推理。实验表明,基于 XVR 微调的模型在多视角及机器人空间推理基准测试中显著提升,并有效迁移至真实机器人操作任务,证明了显式训练跨视图空间关系对增强推理能力的有效性。

AI 推荐理由

论文核心聚焦于多视角空间推理能力的提升,通过数据集构建与微调直接增强模型的推理机制。

研究机构
KAIST Hanyang University Yonsei University Seoul National University
论文信息
作者 Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim et al.
发布日期 2026-03-30
arXiv ID 2603.27967
相关性评分 9/10 (高度相关)