self-improvement optimization LLM agent stochastic optimization
摘要

针对复杂系统优化依赖人工迭代的问题,本文将其形式化为随机生成优化问题,提出 POLCA 框架。该框架利用大语言模型作为优化器,结合数值奖励与文本反馈自动探索最优解。POLCA 通过优先级队列平衡探索与利用,引入ε-Net 机制维持参数多样性,并利用 LLM 总结器进行跨试验元学习。理论证明其在随机环境下收敛至近优解,实验表明其在多项基准测试中优于现有算法,具备高效的样本与时间利用率。

AI 推荐理由

论文提出基于 LLM 的随机生成优化框架,通过反馈实现系统自我改进与迭代,核心契合自我进化主题。

研究机构
威斯康星大学麦迪逊分校 Google DeepMind Google Research
论文信息
作者 Xuanfei Ren, Allen Nie, Tengyang Xie, Ching-An Cheng
发布日期 2026-03-16
arXiv ID 2603.14769
相关性评分 9/10 (高度相关)