摘要
本文旨在解决从偏微分方程(PDE)规范自动生成可执行数值求解器的挑战。针对现有基准仅关注语法正确性而忽视数值精度与效率的问题,作者提出了 PDEAgent-Bench。这是首个专为 PDE 求解器生成设计的多指标、多库基准,涵盖 645 个实例及多种主流有限元库。该基准采用分阶段评估框架,严格检验代码的可执行性、数值准确性及计算效率。实验表明,当前大模型虽能生成可运行代码,但在满足精度和效率要求时通过率显著下降,揭示了其在数值可靠性方面的局限。
AI 推荐理由
论文评估 Agent 在复杂数学推理(PDE 求解)中的表现,核心在于逻辑与数值推理能力。
研究机构
University of Science and Technology of China
Beijing University of Posts and Telecommunications
Shanghai Jiao Tong University
论文信息