self-play fine-tuning Rényi divergence adaptive learning LLM evolution
摘要

自博弈微调使大语言模型无需额外人工标注即可超越监督微调。现有方法多依赖固定散度机制,难以适应不同训练阶段。本文提出 IRIS,一种基于 Rényi 散度的自博弈微调框架,具备连续可调目标函数。该方法将目标分解为两项独立的风险项,并通过阶数参数α控制指数重要性权重。理论分析表明,多种自博弈目标可视为α特定取值下的极限情形。实验显示,IRIS 在多个基准上优于基线,仅用 2.6 万标注样本即超越全量数据监督微调。

AI 推荐理由

提出基于自博弈的迭代微调框架,实现模型自我改进与自适应训练,属核心进化研究。

研究机构
Graduate School of Information, Production and Systems, Waseda University, Fukuoka, Japan
论文信息
作者 Wenjie Liao, Like Wu, Liangjie Zhao, Shihui Xu, Shigeru Fujimura
发布日期 2026-04-22
arXiv ID 2604.20933
相关性评分 9/10 (高度相关)