Agent Benchmark Tool Use Scientific Discovery Code Generation
摘要

针对现有基准难以捕捉真实科研工作复杂性的问题,本文提出 Collider-Bench。该基准要求 LLM 智能体仅凭公开论文和开源软件,复现大型强子对撞机(LHC)的实验分析。任务需智能体利用物理推理与领域知识填补细节缺失,构建可执行的模拟与筛选流程,并预测碰撞事件产额。研究通过直方图指标量化 fidelity,结合 LLM 法官检测幻觉等定性失败模式,并计算成本。结果显示,当前通用编码智能体尚无法稳定超越有人类物理学家参与的解决方案。

AI 推荐理由

论文核心评估 Agent 在复杂科学场景中调用工具、编写代码及复现分析的技能。

研究机构
New High Energy Theory Center Department of Physics & Astronomy Rutgers University
论文信息
作者 Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih
发布日期 2026-05-13
arXiv ID 2605.13950
相关性评分 8/10 (高度相关)