Prompt Optimization Compositional Learning Agent Self-Improvement Discrete Codebook
摘要

自动提示优化(APO)虽推动了基于 LLM 的代理工作流,但现有方法将提示视为整体字符串进行全局编辑,导致更新脆弱且无法复用子行为。本文提出提示词码本(PCO),一种新颖的组合式提示优化框架,将 APO 重构为对自然语言本能(原子化、可复用指令单元)有限词汇的离散学习。PCO 通过离散码本组织提示构建知识,利用基于 LLM 的编码器为每个输入路由至少量子集,生成器将其组合成提示,评论家则输出结构化 verdict 并分解为每变量文本梯度,在语言值最小最大目标下联合训练各模块。实验表明,PCO 在多个基准上显著优于零-shot 及最强基线 GEPA,同时大幅减少提示长度。

AI 推荐理由

论文提出提示词优化框架,通过离散组合学习实现指令的自我改进与自适应,属于 Agent 自我进化核心研究。

研究机构
IIT Delhi, India
论文信息
作者 Jyotirmoy Nath, Neeraj Kumar, Brejesh Lall
发布日期 2026-05-27
arXiv ID 2605.28360
相关性评分 9/10 (高度相关)