Long-term Memory Personalization Benchmark User Preference
摘要

大型语言模型正日益成为个人助手,用户在长期交互中表现出复杂多样的偏好。然而,评估 LLM 在真实长程场景中遵循这些偏好的能力仍显不足。本文提出 RealPref 基准,用于评估个性化交互中的真实偏好遵循能力。该基准包含 100 个用户画像、1300 条个性化偏好及长程交互历史,涵盖从显式到隐式的多种偏好表达形式。结果显示,随着上下文长度增加及偏好表达趋于隐式,LLM 性能显著下降,且将偏好理解泛化至未见场景极具挑战。本研究为开发更适应用户需求的感知型 LLM 助手奠定了基础。

AI 推荐理由

论文核心研究长程交互中的用户偏好记忆与保持,直接针对长期记忆机制进行评估。

研究机构
新加坡国立大学
论文信息
作者 Qianyun Guo, Yibo Li, Yue Liu, Bryan Hooi
发布日期 2026-03-04
arXiv ID 2603.04191
相关性评分 9/10 (高度相关)