Long-term Memory Belief Dynamics Benchmark Opinion Drift
摘要

大型语言模型常被用作长程对话智能体,但现有记忆基准多将用户信息视为静态事实,忽视了人类观点随时间变化的特性。本文提出 BeliefShift,一个专为评估多会话交互中信念动态设计的纵向基准,涵盖时间信念一致性、矛盾检测及证据驱动修正三个赛道。数据集包含 2400 条跨健康、政治等领域的人工标注轨迹。实验评估了七种主流模型,揭示了个性化与抗漂移能力之间的权衡,并提出了信念修正准确率等四项新指标。

AI 推荐理由

论文核心研究长程交互中的记忆动态,提出信念一致性与漂移评估基准。

研究机构
Independent AI Researcher, Texas, USA University of North Carolina at Charlotte, North Carolina, USA Independent Researcher, Hyderabad, India
论文信息
作者 Praveen Kumar Myakala, Manan Agrawal, Rahul Manche
发布日期 2026-03-25
arXiv ID 2603.23848
相关性评分 9/10 (高度相关)