摘要
针对现有基准仅在单次响应中评估模型能力的局限,本文提出 Spatial-Gym 环境,将路径查找作为含回溯选项的序列决策任务,以隔离并测试空间约束推理能力。实验评估了八种模型在不同设置下的表现,发现最强模型解决率仍远低于人类。研究表明:模型无法随难度扩展推理努力;视觉输入反而降低解决率;扩展的思维链推理在逐步设置中仍保持显著精度优势。该框架为诊断模型局限及通过强化学习提升空间推理提供了新途径。
AI 推荐理由
论文核心研究空间推理能力,评估思维链与逐步推理对解决空间约束任务的影响。
研究机构
University of Göttingen, Germany
论文信息