摘要
大型语言模型的演进正从单一可验证任务转向复杂的开放世界场景,给后训练阶段带来巨大挑战。现有方法多依赖固定奖励权重,忽视了非平稳学习动态及数据异构性。为此,本文提出 SPARD 框架,通过感知学习进度建立自动化自步课程,动态调整多目标奖励权重与数据重要性,使学习意图与数据效用同步,以实现最优性能。多基准实验表明,SPARD 显著提升了模型在各领域的能力。
AI 推荐理由
论文提出自步课程框架,通过动态调整奖励实现模型自我进化与对齐,核心聚焦持续学习与自适应。
研究机构
University of Science and Technology of China
Xiaohongshu Inc.
论文信息