摘要
当前大语言模型改进主要依赖离线训练,忽视了真实部署中积累的丰富经验。本文提出在线经验学习(OEL)框架,使模型能从自身部署经验中持续进化。该框架包含两阶段:首先从用户端交互轨迹中提取可迁移的经验知识;其次通过在线策略上下文蒸馏将知识固化到模型参数中,无需访问用户环境。两阶段迭代形成在线学习闭环,提升模型性能。实验表明,OEL 在多轮迭代中显著提升任务准确率与令牌效率,且提取的经验知识比原始轨迹更有效。
AI 推荐理由
论文提出在线经验学习框架,使模型通过部署经验持续自我改进与迭代进化,核心聚焦自我进化机制。
研究机构
Microsoft Research
论文信息