摘要
PlanarBench 旨在测试大语言模型是否能在仅给定边列表的情况下,将平面图绘制为 ASCII 艺术图。这是一项空间推理任务,由于边的顺序、方向及节点标签均可置换,该任务有效抵抗了记忆化策略。研究在 199 个最简单的非同构连通平面图(2 至 7 个顶点)上评估了 91 个模型。研究发现,边的数量是难度的主要预测因子(相关系数 r = -0.85),这一结论在此前仅以节点数量为难度轴心的大语言模型图基准测试中未曾被报道。
AI 推荐理由
论文核心评估 LLM 的空间推理能力,通过平面图绘制任务测试逻辑与几何理解,属推理研究。
研究机构
oleksandr@tvori.info
论文信息