RL Alignment Self-Paced Learning Multi-Objective Optimization LLM Evolution
摘要

大型语言模型的演进正从单一可验证任务转向复杂的开放世界场景,给后训练阶段带来巨大挑战。现有方法多依赖固定奖励权重,忽视了非平稳学习动态及数据异构性。为此,本文提出 SPARD 框架,通过感知学习进度建立自动化自步课程,动态调整多目标奖励权重与数据重要性,使学习意图与数据效用同步,以实现最优性能。多基准实验表明,SPARD 显著提升了模型在各领域的能力。

AI 推荐理由

论文提出自步课程框架,通过动态调整奖励实现模型自我进化与对齐,核心聚焦持续学习与自适应。

研究机构
University of Science and Technology of China Xiaohongshu Inc.
论文信息
作者 Xuyang Zhi, Peilun zhou, Chengqiang Lu, Hang Lv, Yiwei Liang et al.
发布日期 2026-04-09
arXiv ID 2604.07837
相关性评分 9/10 (高度相关)