摘要
自博弈强化学习通过模型生成的任务训练语言模型,实现提议者与求解者的协同进化,但常面临崩溃与不稳定。本文指出稳定性由数据级门控和奖励信号两个杠杆控制,且二者作用不对称。实验表明,严格的数据门控足以维持各种奖励变体下的稳定性,而无门控时任何奖励均无效。研究揭示了“基座提议者悖论”,即拥有真值访问的提议者在特定条件下反而加速崩溃。结论认为数据级门控而非奖励校准是自博弈稳定性的关键约束。
AI 推荐理由
论文核心研究自博弈 RL 中模型的协同进化、自我改进机制及崩溃问题,属于典型的自我进化范畴。
研究机构
University of California, Santa Barbara
Cisco Research
论文信息