Self-Play LLM Alignment Self-Supervised Learning Adaptive Weighting
摘要

针对现有自训练方法对合成数据质量敏感及迭代中优化效率递减的问题,本文提出一种名为 TPAW 的新型自博弈算法。该方法在完全自监督设定下,采用团队协作框架,使当前策略模型与历史检查点既协作又竞争,以提升对齐稳定性。此外,设计了两种自适应加权机制:响应重加权方案动态调整目标响应的重要性,玩家加权策略调节团队成员贡献。实验表明,TPAW 在多种基准测试中均优于现有基线,无需额外人工监督即可迭代优化模型对齐。

AI 推荐理由

论文提出基于自博弈的自我进化算法,通过自适应权重机制实现无监督下的模型迭代对齐与自我改进。

研究机构
Harbin Institute of Technology, Shenzhen, China Beijing Academy of Artificial Intelligence, Beijing, China
论文信息
作者 Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang et al.
发布日期 2026-05-11
arXiv ID 2605.09922
相关性评分 9/10 (高度相关)