摘要
本文提出了持续学习基准(CL-Bench),这是首个经专家验证的高难度基准,旨在评估基于 LLM 的系统是否能通过经验真正提升性能。该基准涵盖六个多样化领域,任务设计包含可学习的潜在结构,仅对有状态系统开放。研究评估了从朴素上下文学习到专用记忆系统等多种架构,发现现有系统在持续学习上仍有不足:常过度拟合即时观察或无法跨实例复用知识,且专用记忆系统表现不如朴素方法。CL-Bench 填补了真实场景下持续学习评估的空白。
AI 推荐理由
论文核心研究 Agent 通过序列经验自我改进的能力,即持续学习,属于自我进化范畴。
研究机构
UC Berkeley
Snorkel AI
University of Wisconsin-Madison
论文信息