摘要
针对多模态大语言模型(MLLM)在跨视角空间智能方面的不足,本文提出了 CrossView Suite。该套件包含三个核心组件:CrossViewSet,一个由多智能体引擎构建的大规模高质量跨视角指令数据集;CrossViewBench,用于系统评估跨视角空间理解能力的场景分离基准;以及 CrossViewer,一种遵循“感知 - 对齐 - 推理”范式的三阶段框架。该方法通过自适应空间区域标记化和显式多视角对象对齐,有效融合了特征,显著增强了 MLLM 的跨视角推理能力,推动其从单视角感知迈向真实世界的空间智能。
AI 推荐理由
论文核心解决多视角空间推理问题,提出对齐机制与推理框架,显著提升 MLLM 推理能力。
研究机构
Zhejiang University
论文信息