摘要
针对复杂系统优化依赖人工迭代的问题,本文将其形式化为随机生成优化问题,提出 POLCA 框架。该框架利用大语言模型作为优化器,结合数值奖励与文本反馈自动探索最优解。POLCA 通过优先级队列平衡探索与利用,引入ε-Net 机制维持参数多样性,并利用 LLM 总结器进行跨试验元学习。理论证明其在随机环境下收敛至近优解,实验表明其在多项基准测试中优于现有算法,具备高效的样本与时间利用率。
AI 推荐理由
论文提出基于 LLM 的随机生成优化框架,通过反馈实现系统自我改进与迭代,核心契合自我进化主题。
研究机构
威斯康星大学麦迪逊分校
Google DeepMind
Google Research
论文信息