Self-play RLHF Self-improvement Open-ended Tasks
摘要

自博弈已成为训练大语言模型的新范式,但现有研究多限于数学和编码等可验证任务。本文提出 POP 框架,将自博弈扩展至开放型任务。该方法利用同一模型合成评估规则及输入输出对,并基于丰富的预训练语料进行接地,以缩小生成与验证差距、减少奖励欺骗并防止模式坍塌。实验表明,POP 显著提升了 Qwen-2.5-7B 在医疗问答、创意写作等任务上的表现。

AI 推荐理由

论文提出基于自博弈的自我改进框架,利用规则生成与反馈训练模型,核心聚焦 Agent 自我进化。

研究机构
Department of Computer Science, Cornell University
论文信息
作者 Chengyu Huang, Sheng-Yen Chou, Zhengxin Zhang, Claire Cardie
发布日期 2026-04-21
arXiv ID 2604.20051
相关性评分 9/10 (高度相关)