摘要
语言模型需泛化至新环境并适应如 AlphaEvolve 等推理时搜索过程,但标准后训练优化标量奖励导致响应多样性不足。本文提出向量策略优化(VPO),一种强化学习算法,显式训练策略以预判多样化的下游奖励函数并生成多样解。VPO 利用实践中奖励的向量特性(如代码生成的多测试用例正确性),作为 GRPO 优势估计器的替代方案,促使模型输出在向量奖励空间中针对不同权衡特化的解集。实验表明,VPO 在四项任务中匹配或超越最强标量 RL 基线,且随搜索预算增加优势扩大,成功解锁了 GRPO 无法解决的进化搜索难题。
AI 推荐理由
论文提出 VPO 算法优化多样性以支持推理时搜索和进化搜索,直接解决自我进化中的探索问题。
研究机构
MIT
Sakana AI
IBM Computing Reserch Lab
论文信息