Benchmark Mathematical Reasoning Code Generation Scientific Computing
摘要

本文旨在解决从偏微分方程(PDE)规范自动生成可执行数值求解器的挑战。针对现有基准仅关注语法正确性而忽视数值精度与效率的问题,作者提出了 PDEAgent-Bench。这是首个专为 PDE 求解器生成设计的多指标、多库基准,涵盖 645 个实例及多种主流有限元库。该基准采用分阶段评估框架,严格检验代码的可执行性、数值准确性及计算效率。实验表明,当前大模型虽能生成可运行代码,但在满足精度和效率要求时通过率显著下降,揭示了其在数值可靠性方面的局限。

AI 推荐理由

论文评估 Agent 在复杂数学推理(PDE 求解)中的表现,核心在于逻辑与数值推理能力。

研究机构
University of Science and Technology of China Beijing University of Posts and Telecommunications Shanghai Jiao Tong University
论文信息
作者 Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei et al.
发布日期 2026-05-10
arXiv ID 2605.09636
相关性评分 8/10 (高度相关)