Multimodal Reasoning Spatial Understanding Geometric Perception MLLM
摘要

迈向人工超智能需要丰富的感知能力,而克服多模态大语言模型(MLLM)有限的空间理解是关键前沿。现有方法往往僵化地向所有输入注入几何信号,忽略了其必要性并增加了计算开销。本文框架赋予模型感知不足的意识,使其能在 2D 线索不足时自主调用几何特征进行推理。我们首先引入独立的几何输入通道并进行对齐训练,随后构建专用的空间感知监督微调数据集,激活模型内部线索以自主判断几何信息的必要性。实验表明,该方法在显著提升空间推理能力的同时,未损害 2D 视觉推理性能。

AI 推荐理由

论文核心在于通过引入几何感知提升多模态模型的空间推理能力,解决推理中的感知不足问题。

研究机构
中国科学院自动化研究所 阿布扎比,阿联酋
论文信息
作者 Ruiheng Liu, Haihong Hao, Mingfei Han, Xin Gu, Kecheng Zhang et al.
发布日期 2026-03-11
arXiv ID 2603.10370
相关性评分 9/10 (高度相关)