摘要
针对与冻结黑盒大语言模型交互的挑战,本文提出一种基于经验迭代蒸馏的强化学习框架,用于训练习得式提示策略。该架构优化轻量级提示器模型,以最大化冻结工作模型的任务奖励。通过结合标量奖励与密集文本批评的对比经验缓冲区,该方法将迭代提示精炼转化为单次策略权重。在 Big Bench Extra Hard 和 Tau-bench 套件上的实验显示,逻辑推理和工具使用任务性能显著提升,分别达到 90% 和 91%,且样本效率优于现有进化基线。
AI 推荐理由
论文核心聚焦于通过强化学习优化提示策略,显著提升黑盒模型在多步推理任务中的表现。
研究机构
Google Research, Mountain View, CA
论文信息