Self-Play RL Model Collapse Data Gating Co-evolution Stability Analysis
摘要

自博弈强化学习通过模型生成的任务训练语言模型,实现提议者与求解者的协同进化,但常面临崩溃与不稳定。本文指出稳定性由数据级门控和奖励信号两个杠杆控制,且二者作用不对称。实验表明,严格的数据门控足以维持各种奖励变体下的稳定性,而无门控时任何奖励均无效。研究揭示了“基座提议者悖论”,即拥有真值访问的提议者在特定条件下反而加速崩溃。结论认为数据级门控而非奖励校准是自博弈稳定性的关键约束。

AI 推荐理由

论文核心研究自博弈 RL 中模型的协同进化、自我改进机制及崩溃问题,属于典型的自我进化范畴。

研究机构
University of California, Santa Barbara Cisco Research
论文信息
作者 Sophia Xiao Pu, Zhaotian Weng, Chengzhi Liu, Jayanth Srinivasa, Gaowen Liu et al.
发布日期 2026-05-21
arXiv ID 2605.22217
相关性评分 9/10 (高度相关)