Self-Play Self-Improvement Verifiable Reasoning Curriculum Learning
摘要

本文提出从“学习回答”转向“学习提问”的范式,旨在让语言模型在无监督下生成可验证问题、求解并利用反馈实现自我改进。我们引入了 ANCORA 框架,统一策略交替扮演提出者与求解者。其核心机制包括耦合优势的双层群相对更新、投影至有效输出流形的迭代自蒸馏 SFT,以及基于 UCB 引导的课程 DAG。实验表明,该方法显著提升了代码转换任务的通过率,并在其他基准上展现出优异的迁移能力。

AI 推荐理由

论文提出通过自博弈生成问题并自我改进,核心机制是无监督下的自我进化与能力提升。

研究机构
Wuhan University
论文信息
作者 Chengcao Yang, Jun Chen
发布日期 2026-04-30
arXiv ID 2604.27644
相关性评分 9/10 (高度相关)