Reinforcement Learning Self-Improvement Dynamic Constraints LLM Fine-Tuning
摘要

约束对于稳定强化学习微调至关重要,但常与优化目标冲突。本文提出“动态约束”机制,通过参考模型作为“在线精炼器”,对微调模型的输出进行最小化修正,保留正确内容并修复错误。随后利用监督微调损失训练模型生成精炼后的输出。该机制能根据输出质量自动调整约束强度。实验表明,该方法在对话和代码生成任务中优于 KL 正则化及无约束基线,显著提升了任务奖励并保持训练稳定性。

AI 推荐理由

提出动态约束与在线精炼机制,实现模型在微调中的自我修正与能力进化。

研究机构
中国科学院自动化研究所 中国科学院大学人工智能学院
论文信息
作者 Hao Ma, Zhiqiang Pu, Yang Liu, Xiaolin Ai
发布日期 2026-03-18
arXiv ID 2603.18088
相关性评分 9/10 (高度相关)