Reinforcement Learning LLM Post-Training Adaptive Optimization Variance Reduction
摘要

针对大语言模型后训练中是否使用学习评论家的难题,本文指出在稀疏奖励下评论家可能增加方差。通过将基线选择建模为卡尔曼滤波问题,证明解释方差(EV)可判定评论家有效性。据此提出 EVPO 算法,动态切换基线策略,确保每步方差不高于最优固定基线。实验表明该方法在控制、代理交互及数学推理任务上均优于 PPO 和 GRPO。

AI 推荐理由

提出自适应策略优化算法,实现模型训练过程中的自我调节与性能进化。

研究机构
北京大学 复旦大学 上海智谱AI研究
论文信息
作者 Chengjun Pan, Shichun Liu, Jiahang Lin, Dingwei Zhu, Jiazheng Zhang et al.
发布日期 2026-04-21
arXiv ID 2604.19485
相关性评分 9/10 (高度相关)