摘要
针对大语言模型 Agent 在动态环境中缺乏持续内部化测试时反馈的问题,本文提出技能增强测试时协同进化框架(LifeSkill)。该框架包含两阶段强化学习:一是验证器引导的技能学习,通过奖励有用技能解决监督缺失问题;二是在线技能内部化,将技能条件轨迹转化为奖励信号,使 Agent 在测试时直接更新参数以内化推理能力,避免上下文膨胀。实验表明该方法显著提升了终身学习性能。
AI 推荐理由
论文提出测试时协同进化框架,核心在于 Agent 的自我改进与参数内部化,符合自我进化定义。
研究机构
School of Computer Science and Technology, East China Normal University
论文信息