Lifelong Learning Test-Time Training Reinforcement Learning Skill Internalization
摘要

针对大语言模型 Agent 在动态环境中缺乏持续内部化测试时反馈的问题,本文提出技能增强测试时协同进化框架(LifeSkill)。该框架包含两阶段强化学习:一是验证器引导的技能学习,通过奖励有用技能解决监督缺失问题;二是在线技能内部化,将技能条件轨迹转化为奖励信号,使 Agent 在测试时直接更新参数以内化推理能力,避免上下文膨胀。实验表明该方法显著提升了终身学习性能。

AI 推荐理由

论文提出测试时协同进化框架,核心在于 Agent 的自我改进与参数内部化,符合自我进化定义。

研究机构
School of Computer Science and Technology, East China Normal University
论文信息
作者 Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei et al.
发布日期 2026-06-03
arXiv ID 2606.04815
相关性评分 9/10 (高度相关)