摘要
本文作为 ATANT v1.0 的姊妹篇,旨在澄清其定义的“连续性”与现有主流记忆基准(如 LOCOMO、LongMemEval 等)的区别。通过结构分析证明,现有基准均未覆盖 v1.0 定义的七项关键属性中的大部分。文章揭示了各基准的方法论缺陷(包括 LOCOMO 的评分漏洞),并发布了对比数据以证明两者衡量的是不同能力。作者强调,混淆这些基准导致领域忽视了对真正连续性属性的投入,而非否定其他基准的价值。
AI 推荐理由
论文核心在于评估和定义 Agent 的连续性记忆属性,对比现有记忆基准的不足。
研究机构
Kenotic Labs
论文信息