摘要
针对大语言模型后训练中是否使用学习评论家的难题,本文指出在稀疏奖励下评论家可能增加方差。通过将基线选择建模为卡尔曼滤波问题,证明解释方差(EV)可判定评论家有效性。据此提出 EVPO 算法,动态切换基线策略,确保每步方差不高于最优固定基线。实验表明该方法在控制、代理交互及数学推理任务上均优于 PPO 和 GRPO。
AI 推荐理由
提出自适应策略优化算法,实现模型训练过程中的自我调节与性能进化。
研究机构
北京大学
复旦大学
上海智谱AI研究
论文信息