摘要
基于 GRPO 风格的算法已成为outcome-only奖励下训练LLM搜索代理的标准策略。现有方法通常丢弃全对或全错的零方差查询组。本文假设并验证了查询在训练过程中会随策略进化在零方差和有效信号状态间翻转。据此提出“查询回收”技术,将零方差组返回可变池以供重采样,使有效训练分布与策略协同进化。实验表明,1.7B参数模型在该方法下性能媲美7B模型,回收查询在训练末期贡献了约四分之三的有效批次。
AI 推荐理由
论文提出查询回收机制,使训练分布随策略进化而协同演化,核心关注 Agent 的自我改进与自适应训练过程。
研究机构
Language Technologies Institute, Carnegie Mellon University, United States
Instituto Superior Técnico and INESC-ID, University of Lisbon, Portugal
NOVA LINCS, NOVA School of Science and Technology, Portugal
论文信息