User Modeling Memory Architecture Persona Induction Direct Preference Optimization
摘要

行为日志为用户建模提供丰富信号,但存在噪声且意图交织。现有工作利用大语言模型生成可解释的自然语言角色,但评估多侧重下游效用,缺乏对角色本身质量的保证。本文提出一种分层框架,将用户动作聚合为意图记忆,并通过聚类与标记这些记忆来诱导多个基于证据的角色。我们将角色归纳表述为关于角色质量(涵盖聚类凝聚力、角色 - 证据一致性及真实性)的优化问题,并利用直接偏好优化(DPO)的分组扩展进行训练。实验表明,该方法能诱导更连贯、基于证据且可信的角色,同时提升未来交互预测性能。

AI 推荐理由

论文提出分层框架将用户行为聚合成意图记忆,核心在于记忆架构与证据对齐。

研究机构
埃默里大学计算机科学系,美国佐治亚州亚特兰大
论文信息
作者 Nayoung Choi, Haeyu Jeong, Changbong Kim, Hongjun Lim, Jinho D. Choi
发布日期 2026-04-28
arXiv ID 2604.26120
相关性评分 9/10 (高度相关)