摘要
本文提出简单测试时评估驱动扩展(SimpleTES)框架,旨在解决如何原则性地扩展评估驱动的科学发现循环。该框架策略性结合并行探索、反馈驱动优化与局部选择,在六大领域二十一个科学问题中均发现最先进解,显著超越前沿模型基线。此外,利用生成的轨迹历史对模型进行后训练,不仅提升了已知问题的效率,更增强了对未知问题的泛化能力,发现了基础模型无法触及的新解,确立了评估驱动循环扩展作为推动 LLM 科学发现的核心路径。
AI 推荐理由
论文核心在于通过评估驱动的试错循环实现自我改进与持续学习,属于典型的自我进化机制。
研究机构
Wizard Intelligence Learning Lab, Stanford University
Peking University
The Hong Kong University of Science and Technology (Guangzhou)
论文信息