Persistent Memory Multi-Session Agents Benchmark Long-horizon Interaction
摘要

近期代理 AI 的进展使其能通过工具使用、推理和多步规划完成复杂任务。然而,现有基准仅在单会话内评估代理,忽略了实现个性化用户目标所需整合的过往行为、偏好及决策。本文提出 Momento,这是一个面向多会话服务环境的持久性代理任务完成基准,要求代理在执行工具介导的关键行动时,解决跨会话的时间依赖和用户目标演变问题。实验表明,当前代理主要因误判用户状态而失败,即将过时的历史信息视为可靠上下文而非需重新验证的数据,揭示了现有能力与真实长程人机交互间的巨大差距。

AI 推荐理由

论文核心研究多会话场景下的持久记忆机制,评估代理整合历史信息的能力。

研究机构
Institut Teknologi Bandung Stanford University Capital One
论文信息
作者 Adril Putra Merin, David Anugraha, Ayu Purwarianti, Genta Indra Winata
发布日期 2026-05-30
arXiv ID 2606.00832
相关性评分 9/10 (高度相关)