摘要
自动提示优化(APO)无需人工工程即可提升大模型性能,但现有反射式方法如 GEPA 存在黑盒且无标签的局限,导致优化轨迹不可解释及系统性失败。本文提出 VISTA,一种多智能体 APO 框架,将假设生成与提示重写解耦,实现语义标记假设、并行小批量验证及可解释的优化轨迹。通过结合随机重启和ε-贪婪采样的双层探索 - 利用机制,有效逃离局部最优。实验表明,VISTA 在缺陷种子下将 GSM8K 准确率从 13.50% 恢复至 87.57%,并在多项基准中持续优于基线。
AI 推荐理由
论文核心研究基于反思的提示优化与自我改进机制,解决黑盒优化问题。
研究机构
加州大学伯克利分校
华中科技大学
合肥工业大学
论文信息