摘要
语言智能体在单任务推理中耗时巨大,但往往未能有效利用过往经验。现有基准难以严谨评估智能体的持续学习能力,常局限于长上下文检索或依赖缺乏跨任务关联分析的简单任务流。本文提出 AgentCL 评估框架,通过构建可复用子解决方案的组合式任务流,对比简单任务流,以量化迁移增益。研究利用该基准评估非参数记忆设计,并开发 MemProbe 探针方法诊断记忆巩固过程中的经验过滤机制。实验表明,受控任务流能更清晰地区分记忆设计的可塑性,揭示了当前设计在平衡可塑性与稳定复用方面的不足。
AI 推荐理由
论文核心聚焦于智能体的持续学习与非参数记忆设计评估,提出新框架诊断记忆机制。
研究机构
Ohio State University
Johns Hopkins University
Intuit AI Research
The Ohio State University
论文信息