Personalized Agents Long-term Memory Benchmark Proactive Interaction
摘要

大型语言模型已演变为与现实任务协作的交互式智能体,有效协作依赖于超越显式陈述的用户理解。现有基准主要评估推理与工具使用,忽视了现实场景中推断和利用用户偏好的挑战。为此,本文提出 VitaBench 2.0,旨在评估长期交互中智能体的个性化与主动行为。该基准将任务组织为时间有序序列,要求智能体从碎片化交互中持续提取、利用并更新用户偏好,并通过主动获取缺失信息来评估主动性。此外,研究提供了可扩展的记忆接口以对比不同记忆架构,揭示了当前模型在真实世界个性化决策中的能力瓶颈。

AI 推荐理由

论文核心关注长期交互中的用户偏好提取、更新与记忆架构评估,直接针对记忆机制。

研究机构
National University of Singapore University of Science and Technology of China Beijing University of Posts and Telecommunications Zhejiang University
论文信息
作者 Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao et al.
发布日期 2026-05-26
arXiv ID 2605.27141
相关性评分 9/10 (高度相关)