Spatial Reasoning Robustness Visual Degradation Benchmark MLLM
摘要

多模态大语言模型(MLLMs)在空间智能方面进展迅速,但现有基准多假设输入图像完美,忽视了现实部署中常见的运动模糊、低光照等视觉退化问题。本文提出 SpaceDG,首个面向退化感知的空间理解大规模数据集。通过结合 3D 高斯泼溅渲染与物理退化合成引擎,模拟九种退化类型,构建含百万级问答对的数据集及人工验证基准。评估显示视觉退化严重损害空间推理能力,而基于该数据的微调可显著提升鲁棒性,甚至在退化条件下超越人类表现。

AI 推荐理由

论文核心评估 MLLM 在视觉退化下的空间推理鲁棒性,直接针对推理能力。

研究机构
上海交通大学 上海人工智能实验室 东京大学 北京航空航天大学 重庆大学 西北工业大学
论文信息
作者 Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao et al.
发布日期 2026-05-21
arXiv ID 2605.22536
相关性评分 9/10 (高度相关)