Prompt Optimization Self-Reflection Multi-Agent Black-Box
摘要

自动提示优化(APO)无需人工工程即可提升大模型性能,但现有反射式方法如 GEPA 存在黑盒且无标签的局限,导致优化轨迹不可解释及系统性失败。本文提出 VISTA,一种多智能体 APO 框架,将假设生成与提示重写解耦,实现语义标记假设、并行小批量验证及可解释的优化轨迹。通过结合随机重启和ε-贪婪采样的双层探索 - 利用机制,有效逃离局部最优。实验表明,VISTA 在缺陷种子下将 GSM8K 准确率从 13.50% 恢复至 87.57%,并在多项基准中持续优于基线。

AI 推荐理由

论文核心研究基于反思的提示优化与自我改进机制,解决黑盒优化问题。

研究机构
加州大学伯克利分校 华中科技大学 合肥工业大学
论文信息
作者 Shiyan Liu, Qifeng Xia, Qiyun Xia, Yisheng Liu, Xinyu Yu et al.
发布日期 2026-03-19
arXiv ID 2603.18388
相关性评分 9/10 (高度相关)