Spatial Intelligence Multi-view Reasoning MLLM Dataset & Benchmark
摘要

针对多模态大语言模型(MLLM)在跨视角空间智能方面的不足,本文提出了 CrossView Suite。该套件包含三个核心组件:CrossViewSet,一个由多智能体引擎构建的大规模高质量跨视角指令数据集;CrossViewBench,用于系统评估跨视角空间理解能力的场景分离基准;以及 CrossViewer,一种遵循“感知 - 对齐 - 推理”范式的三阶段框架。该方法通过自适应空间区域标记化和显式多视角对象对齐,有效融合了特征,显著增强了 MLLM 的跨视角推理能力,推动其从单视角感知迈向真实世界的空间智能。

AI 推荐理由

论文核心解决多视角空间推理问题,提出对齐机制与推理框架,显著提升 MLLM 推理能力。

研究机构
Zhejiang University
论文信息
作者 Wei Wang, Yuqian Yuan, Tianwei Lin, Wenqiao Zhang, Siliang Tang et al.
发布日期 2026-05-18
arXiv ID 2605.18621
相关性评分 9/10 (高度相关)