Reinforcement Learning Diversity Optimization Test-Time Search Evolutionary Algorithms
摘要

语言模型需泛化至新环境并适应如 AlphaEvolve 等推理时搜索过程,但标准后训练优化标量奖励导致响应多样性不足。本文提出向量策略优化(VPO),一种强化学习算法,显式训练策略以预判多样化的下游奖励函数并生成多样解。VPO 利用实践中奖励的向量特性(如代码生成的多测试用例正确性),作为 GRPO 优势估计器的替代方案,促使模型输出在向量奖励空间中针对不同权衡特化的解集。实验表明,VPO 在四项任务中匹配或超越最强标量 RL 基线,且随搜索预算增加优势扩大,成功解锁了 GRPO 无法解决的进化搜索难题。

AI 推荐理由

论文提出 VPO 算法优化多样性以支持推理时搜索和进化搜索,直接解决自我进化中的探索问题。

研究机构
MIT Sakana AI IBM Computing Reserch Lab
论文信息
作者 Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani et al.
发布日期 2026-05-21
arXiv ID 2605.22817
相关性评分 9/10 (高度相关)