摘要
本文提出 PRISM,一个包含 10,372 个人类校准指令 - 代码对的大规模基准,旨在评估语言模型生成空间正确动画的能力。该基准涵盖中英文真实世界知识可视化场景及 437 个主题类别。我们提出了漏斗式评估框架,包含代码可靠性、空间推理等四项指标。对七个主流 LLM 的系统评估揭示了显著的“执行 - 空间差距”:代码可执行并不保证视觉输出的空间连贯性。PRISM 为推进空间连贯的代码生成提供了原则性基准。
AI 推荐理由
论文核心评估 LLM 的程序化时空推理能力,揭示执行与空间一致性间的差距。
研究机构
School of Artificial Intelligence, Shanghai Jiao Tong University
论文信息