摘要
自博弈微调使大语言模型无需额外人工标注即可超越监督微调。现有方法多依赖固定散度机制,难以适应不同训练阶段。本文提出 IRIS,一种基于 Rényi 散度的自博弈微调框架,具备连续可调目标函数。该方法将目标分解为两项独立的风险项,并通过阶数参数α控制指数重要性权重。理论分析表明,多种自博弈目标可视为α特定取值下的极限情形。实验显示,IRIS 在多个基准上优于基线,仅用 2.6 万标注样本即超越全量数据监督微调。
AI 推荐理由
提出基于自博弈的迭代微调框架,实现模型自我改进与自适应训练,属核心进化研究。
研究机构
Graduate School of Information, Production and Systems, Waseda University, Fukuoka, Japan
论文信息