Benchmark Spatial-Temporal Reasoning Code Generation Video Generation
摘要

本文提出 PRISM,一个包含 10,372 个人类校准指令 - 代码对的大规模基准,旨在评估语言模型生成空间正确动画的能力。该基准涵盖中英文真实世界知识可视化场景及 437 个主题类别。我们提出了漏斗式评估框架,包含代码可靠性、空间推理等四项指标。对七个主流 LLM 的系统评估揭示了显著的“执行 - 空间差距”:代码可执行并不保证视觉输出的空间连贯性。PRISM 为推进空间连贯的代码生成提供了原则性基准。

AI 推荐理由

论文核心评估 LLM 的程序化时空推理能力,揭示执行与空间一致性间的差距。

研究机构
School of Artificial Intelligence, Shanghai Jiao Tong University
论文信息
作者 Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan et al.
发布日期 2026-05-19
arXiv ID 2605.19382
相关性评分 9/10 (高度相关)