摘要
近期自主大语言模型代理已实现机器学习研究的端到端自动化,但现实物理科学更具挑战性,需受物理真理约束的深度推理并依托现有文献。本文聚焦于“阅读 - 复现 - 批判 - 扩展”这一最小研究单元。在规模测试中,代理对 111 篇论文自主执行循环,无需指令即可对约 42% 的论文提出实质性质疑,其中绝大多数需通过执行代码才能发现。在深度测试中,代理针对一篇《自然 - 通讯》论文运行缺失计算,无监督生成了一篇可发表的评论,修正了原结论。
AI 推荐理由
论文核心在于代理基于物理真理进行深度推理、复现验证及批判性扩展,体现高阶推理能力。
研究机构
Department of Physics, Princeton University
论文信息