Spatial Reasoning Dataset Embodied AI LLM Evaluation
摘要

本文介绍了 GSU,一个纯文本网格数据集,旨在评估大语言模型在导航、物体定位和结构组合三项核心任务中的空间推理能力。通过排除视觉输入以隔离感知因素,研究发现多数模型虽掌握基础网格概念,但在处理具身代理的参考系及从坐标列表识别三维形状时表现欠佳。此外,视觉模态的接触并未赋予多模态模型可迁移的三维空间理解力。最后,研究表明最新前沿模型能解决现有任务,而小型语言模型经全量微调或 LoRA 微调后亦有望达到同等性能,为专用具身智能体开发提供了新途径。

AI 推荐理由

论文核心聚焦于评估和提升 LLM 在网格环境下的空间推理能力,属于推理领域的基准研究。

研究机构
伊利诺伊大学厄巴纳-香槟分校
论文信息
作者 Risham Sidhu, Julia Hockenmaier
发布日期 2026-03-18
arXiv ID 2603.17333
相关性评分 9/10 (高度相关)