Scientific Discovery Self-Improvement Evaluation-Driven LLM Agents
摘要

本文提出简单测试时评估驱动扩展(SimpleTES)框架,旨在解决如何原则性地扩展评估驱动的科学发现循环。该框架策略性结合并行探索、反馈驱动优化与局部选择,在六大领域二十一个科学问题中均发现最先进解,显著超越前沿模型基线。此外,利用生成的轨迹历史对模型进行后训练,不仅提升了已知问题的效率,更增强了对未知问题的泛化能力,发现了基础模型无法触及的新解,确立了评估驱动循环扩展作为推动 LLM 科学发现的核心路径。

AI 推荐理由

论文核心在于通过评估驱动的试错循环实现自我改进与持续学习,属于典型的自我进化机制。

研究机构
Wizard Intelligence Learning Lab, Stanford University Peking University The Hong Kong University of Science and Technology (Guangzhou)
论文信息
作者 Haotian Ye, Haowei Lin, Jingyi Tang, Yizhen Luo, Caiyin Yang et al.
发布日期 2026-04-21
arXiv ID 2604.19341
相关性评分 9/10 (高度相关)