摘要
现有大语言模型缺乏持续学习及将短期上下文知识转化为长期参数的能力。受人类学习启发,本文提出“睡眠”范式,包含两个阶段:一是记忆巩固,通过“知识播种”将小模型的记忆蒸馏至大网络以扩展容量;二是“做梦”,利用强化学习生成合成数据课程,在无监督下 rehearse 新知识并精炼现有能力。实验表明该机制在长程任务、持续学习及少-shot 泛化中显著提升模型性能,支持模型自我进化。
AI 推荐理由
论文提出睡眠范式,通过梦境实现自我改进和递归优化,核心聚焦 Agent 自我进化。
研究机构
Google Research
Cornell University
论文信息