Self-Improvement Reinforcement Learning Web-Grounded Reasoning
摘要

针对现有强化学习方法在自我改进中面临的内生漂移或依赖 curated 数据的问题,本文提出 WIST 框架。该方法直接从开放网络学习,通过增量扩展领域树并检索清洗路径一致的语料,构建可控训练环境。利用可验证奖励进行挑战者 - 求解者自博弈,并将可学习性信号反馈以更新节点后验概率,指导自适应课程探索。实验表明,WIST 在多个基座模型上显著优于纯内生演化和基于语料的自博弈基线,展现出强大的领域定向推理提升能力。

AI 推荐理由

论文提出基于网页的迭代自博弈框架,核心目标是实现模型在特定领域的自我改进与进化。

研究机构
哈尔滨工业大学
论文信息
作者 Fangyuan Li, Pengfei Li, Shijie Wang, Junqi Gao, Jianxing Liu et al.
发布日期 2026-03-22
arXiv ID 2603.22352
相关性评分 9/10 (高度相关)