摘要
大型语言模型已演变为与现实任务协作的交互式智能体,有效协作依赖于超越显式陈述的用户理解。现有基准主要评估推理与工具使用,忽视了现实场景中推断和利用用户偏好的挑战。为此,本文提出 VitaBench 2.0,旨在评估长期交互中智能体的个性化与主动行为。该基准将任务组织为时间有序序列,要求智能体从碎片化交互中持续提取、利用并更新用户偏好,并通过主动获取缺失信息来评估主动性。此外,研究提供了可扩展的记忆接口以对比不同记忆架构,揭示了当前模型在真实世界个性化决策中的能力瓶颈。
AI 推荐理由
论文核心关注长期交互中的用户偏好提取、更新与记忆架构评估,直接针对记忆机制。
研究机构
National University of Singapore
University of Science and Technology of China
Beijing University of Posts and Telecommunications
Zhejiang University
论文信息