摘要
生成式世界模型广泛用于视频生成,但其是否遵循物理规则仍难评估。现有基准存在评估框架粗糙、标注偏差及自动化评估缺乏物理意识等挑战。为此,本文提出 PhyGround,一个基于准则的物理推理评估基准,涵盖 13 类物理定律及 250 个精心设计的提示。通过大规模人工研究评估了八个主流模型,并发布了专用物理视觉语言模型 PhyJudge-9B,其偏差显著低于通用模型,支持可复现的自动化评估。
AI 推荐理由
论文核心聚焦于评估生成式世界模型中的物理推理能力,构建基准与专用评判模型。
研究机构
Arash Akbari
Lin Zhao
Arman Akbari
Zoe Y. Lu
Hokin Deng
Sarah Ostadbabas
Jennifer Dy
Yanzhi Wang
论文信息