MLLM Spatial Reasoning Benchmark Orientation Understanding
摘要

人类逐步习得物体方向认知,而现有视觉语言基准常混淆方向与位置。本文提出 DORI,一个受人类认知启发的分层基准,将方向分解为四个维度并在粗粒度与细粒度层面评估。该基准包含 1.3 万余张图像及 3.3 万道选择题,通过隔离边界框和标准化参考系排除干扰。对 24 个主流模型的评估显示,其在通用空间任务表现良好,但在以物体为中心的方向任务上接近随机猜测,暴露出依赖分类启发式而非几何推理的局限,表明方向理解仍是多模态系统的未解难题。

AI 推荐理由

论文核心评估 MLLM 的方向推理能力,揭示几何推理缺陷,属推理研究。

研究机构
波士顿大学 约翰霍普金斯大学
论文信息
作者 Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou et al.
发布日期 2026-03-12
arXiv ID 2603.11410
相关性评分 9/10 (高度相关)