摘要
大型语言模型常被用作长程对话智能体,但现有记忆基准多将用户信息视为静态事实,忽视了人类观点随时间变化的特性。本文提出 BeliefShift,一个专为评估多会话交互中信念动态设计的纵向基准,涵盖时间信念一致性、矛盾检测及证据驱动修正三个赛道。数据集包含 2400 条跨健康、政治等领域的人工标注轨迹。实验评估了七种主流模型,揭示了个性化与抗漂移能力之间的权衡,并提出了信念修正准确率等四项新指标。
AI 推荐理由
论文核心研究长程交互中的记忆动态,提出信念一致性与漂移评估基准。
研究机构
Independent AI Researcher, Texas, USA
University of North Carolina at Charlotte, North Carolina, USA
Independent Researcher, Hyderabad, India
论文信息