摘要
长期运行的 AI 智能体常被视为持久系统,却仍按初始模型评估。本文指出可靠性是智能体全生命周期的属性,而非仅取决于基础模型。作者提出 AgingBench,一种纵向可靠性基准,将智能体老化分为压缩、干扰、修订和维护四种机制。利用时间依赖图和反事实探测,该基准能诊断记忆流水线中写入、检索和利用阶段的故障。实验表明,智能体老化具有多维性,需针对性修复以确保持续可靠部署。
AI 推荐理由
论文核心研究 Agent 记忆机制随时间退化的问题,提出记忆老化分类及诊断方法。
研究机构
The University of Texas at Austin
论文信息