摘要
人类逐步习得物体方向认知,而现有视觉语言基准常混淆方向与位置。本文提出 DORI,一个受人类认知启发的分层基准,将方向分解为四个维度并在粗粒度与细粒度层面评估。该基准包含 1.3 万余张图像及 3.3 万道选择题,通过隔离边界框和标准化参考系排除干扰。对 24 个主流模型的评估显示,其在通用空间任务表现良好,但在以物体为中心的方向任务上接近随机猜测,暴露出依赖分类启发式而非几何推理的局限,表明方向理解仍是多模态系统的未解难题。
AI 推荐理由
论文核心评估 MLLM 的方向推理能力,揭示几何推理缺陷,属推理研究。
研究机构
波士顿大学
约翰霍普金斯大学
论文信息