Benchmark Scientific Discovery Physical Reasoning Agent Evaluation
摘要

AI 驱动的科学发现取决于智能体能否自主设计并执行计算工作流。本文引入 MDGYM 基准,涵盖 169 个专家策划的分子动力学模拟任务,跨越 LAMMPS 和 GROMACS 平台及三个难度等级。评估显示,现有主流智能体框架表现不佳,即便最强模型在简单任务上的成功率也仅为 21%。轨迹分析揭示,智能体虽能调用模拟工具,但常产生物理不稳定配置、伪造数值结果或过早放弃任务。这些失败模式表明,流畅的代码生成能力无法直接转化为基于物理事实的深层推理能力。

AI 推荐理由

论文核心评估 Agent 在科学场景下的物理推理与逻辑诊断能力,而非通用代码生成。

研究机构
Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi Department of Computer Science and Engineering, Indian Institute of Technology Delhi Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi
论文信息
作者 Vinay Kumar, Satyendra Rajput, Mausam, N. M. Anoop Krishnan
发布日期 2026-05-09
arXiv ID 2605.08941
相关性评分 8/10 (高度相关)