摘要
约束对于稳定强化学习微调至关重要,但常与优化目标冲突。本文提出“动态约束”机制,通过参考模型作为“在线精炼器”,对微调模型的输出进行最小化修正,保留正确内容并修复错误。随后利用监督微调损失训练模型生成精炼后的输出。该机制能根据输出质量自动调整约束强度。实验表明,该方法在对话和代码生成任务中优于 KL 正则化及无约束基线,显著提升了任务奖励并保持训练稳定性。
AI 推荐理由
提出动态约束与在线精炼机制,实现模型在微调中的自我修正与能力进化。
研究机构
中国科学院自动化研究所
中国科学院大学人工智能学院
论文信息