摘要
多模态大语言模型(MLLMs)在空间智能方面进展迅速,但现有基准多假设输入图像完美,忽视了现实部署中常见的运动模糊、低光照等视觉退化问题。本文提出 SpaceDG,首个面向退化感知的空间理解大规模数据集。通过结合 3D 高斯泼溅渲染与物理退化合成引擎,模拟九种退化类型,构建含百万级问答对的数据集及人工验证基准。评估显示视觉退化严重损害空间推理能力,而基于该数据的微调可显著提升鲁棒性,甚至在退化条件下超越人类表现。
AI 推荐理由
论文核心评估 MLLM 在视觉退化下的空间推理鲁棒性,直接针对推理能力。
研究机构
上海交通大学
上海人工智能实验室
东京大学
北京航空航天大学
重庆大学
西北工业大学
论文信息