摘要
针对现有强化学习方法在自我改进中面临的内生漂移或依赖 curated 数据的问题,本文提出 WIST 框架。该方法直接从开放网络学习,通过增量扩展领域树并检索清洗路径一致的语料,构建可控训练环境。利用可验证奖励进行挑战者 - 求解者自博弈,并将可学习性信号反馈以更新节点后验概率,指导自适应课程探索。实验表明,WIST 在多个基座模型上显著优于纯内生演化和基于语料的自博弈基线,展现出强大的领域定向推理提升能力。
AI 推荐理由
论文提出基于网页的迭代自博弈框架,核心目标是实现模型在特定领域的自我改进与进化。
研究机构
哈尔滨工业大学
论文信息