Continual Learning Memory Mechanism Evaluation Benchmark Language Agents
摘要

语言智能体在单任务推理中耗时巨大,但往往未能有效利用过往经验。现有基准难以严谨评估智能体的持续学习能力,常局限于长上下文检索或依赖缺乏跨任务关联分析的简单任务流。本文提出 AgentCL 评估框架,通过构建可复用子解决方案的组合式任务流,对比简单任务流,以量化迁移增益。研究利用该基准评估非参数记忆设计,并开发 MemProbe 探针方法诊断记忆巩固过程中的经验过滤机制。实验表明,受控任务流能更清晰地区分记忆设计的可塑性,揭示了当前设计在平衡可塑性与稳定复用方面的不足。

AI 推荐理由

论文核心聚焦于智能体的持续学习与非参数记忆设计评估,提出新框架诊断记忆机制。

研究机构
Ohio State University Johns Hopkins University Intuit AI Research The Ohio State University
论文信息
作者 Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda, Yuguang Yao, Huan Sun et al.
发布日期 2026-06-01
arXiv ID 2606.02461
相关性评分 9/10 (高度相关)