Spatial Reasoning Multimodal LLM Geometric Features Feature Realignment
摘要

多模态大模型(MLLM)在视觉任务中表现优异,但在空间推理方面仍显不足。现有方法通过注入 3D 基础模型的几何特征来缓解此问题,但依赖静态单层提取,导致任务错位偏差。为此,本文提出 GeoAlign 框架,动态聚合多层几何特征以适配实际需求。该方法构建分层几何特征库,利用 MLLM 原始视觉令牌作为内容感知查询,执行逐层稀疏路由,自适应获取各图块的适宜特征。实验表明,该紧凑模型在多个基准上达到最先进水平。

AI 推荐理由

论文核心解决多模态大模型的空间推理缺陷,提出几何特征重对齐框架以提升推理能力。

研究机构
国家工程研究中心视觉技术部,国家关键实验室多媒体信息处理,北京大学计算机学院 美图公司
论文信息
作者 Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang
发布日期 2026-04-14
arXiv ID 2604.12630
相关性评分 9/10 (高度相关)