摘要
多模态大模型(MLLM)在视觉任务中表现优异,但在空间推理方面仍显不足。现有方法通过注入 3D 基础模型的几何特征来缓解此问题,但依赖静态单层提取,导致任务错位偏差。为此,本文提出 GeoAlign 框架,动态聚合多层几何特征以适配实际需求。该方法构建分层几何特征库,利用 MLLM 原始视觉令牌作为内容感知查询,执行逐层稀疏路由,自适应获取各图块的适宜特征。实验表明,该紧凑模型在多个基准上达到最先进水平。
AI 推荐理由
论文核心解决多模态大模型的空间推理缺陷,提出几何特征重对齐框架以提升推理能力。
研究机构
国家工程研究中心视觉技术部,国家关键实验室多媒体信息处理,北京大学计算机学院
美图公司
论文信息