摘要
有效配置大规模语言模型(LLM)实验对推进研究至关重要,但高昂成本限制了传统试错法的应用。针对这一空白,本文提出 AutoLLMResearch,一个模拟人类研究者行为的智能体框架。该框架使智能体能在多保真度环境中交互,从低成本低精度实验中学习通用原则,并将其外推至高精度昂贵场景以识别最优配置。系统包含 LLMConfig-Gym 环境及基于长视野马尔可夫决策过程的训练流程,旨在激励跨保真度的推理与自我改进能力。
AI 推荐理由
论文核心在于 Agent 通过低成本实验学习原则并自我进化,以优化高成本配置。
研究机构
University of Notre Dame
论文信息