self-evolution test-time adaptation reinforcement learning variational synthesis
摘要

尽管基于可验证奖励的强化学习推动了大型推理模型的发展,但在缺乏监督信号的领域仍面临挑战。现有测试时方法受限于静态查询集,易过拟合文本模式。为此,本文提出测试时变分合成(TTVS)框架,利用无标签测试数据动态增强训练流,促使模型自我进化。该框架包含在线变分合成与测试时混合探索两个模块,前者生成语义等价变异以学习深层逻辑,后者平衡准确率驱动的开发与一致性驱动的探索。实验表明,TTVS 在多种架构上表现优异,甚至超越基于大量标注数据的监督强化学习方法。

AI 推荐理由

论文提出 TTVS 框架,使模型在测试时通过动态数据增强实现自我进化,核心聚焦自我改进机制。

研究机构
The Hong Kong University of Science and Technology
论文信息
作者 Sikai Bai, Haoxi Li, Jie Zhang, Yongjiang Liu, Song Guo
发布日期 2026-04-09
arXiv ID 2604.08468
相关性评分 9/10 (高度相关)