Continual Learning Agent Evaluation Stateful Environments LLM Agents
摘要

本文提出了持续学习基准(CL-Bench),这是首个经专家验证的高难度基准,旨在评估基于 LLM 的系统是否能通过经验真正提升性能。该基准涵盖六个多样化领域,任务设计包含可学习的潜在结构,仅对有状态系统开放。研究评估了从朴素上下文学习到专用记忆系统等多种架构,发现现有系统在持续学习上仍有不足:常过度拟合即时观察或无法跨实例复用知识,且专用记忆系统表现不如朴素方法。CL-Bench 填补了真实场景下持续学习评估的空白。

AI 推荐理由

论文核心研究 Agent 通过序列经验自我改进的能力,即持续学习,属于自我进化范畴。

研究机构
UC Berkeley Snorkel AI University of Wisconsin-Madison
论文信息
作者 Parth Asawa, Christopher M. Glaze, Gabriel Orlanski, Ramya Ramakrishnan, Benji Xu et al.
发布日期 2026-06-04
arXiv ID 2606.05661
相关性评分 9/10 (高度相关)