Persona Understanding Behavioral Reasoning User Simulation RLHF
摘要

针对大规模数字痕迹中个性化用户理解的挑战,本文提出 UserGPT 框架。该方法利用大语言模型将冗长嘈杂的行为历史概括为连贯叙事,以捕捉细微的用户演变。为解决真实数据稀缺,开发了用户行为模拟引擎及数据中心语义化模块。此外,设计了结合多阶段监督微调与双过滤组相对策略优化的课程驱动后训练策略,旨在增强对长行为历史的推理能力。实验表明,该框架在整体人物推理任务中表现优异,能有效压缩行为记录并保留关键信息。

AI 推荐理由

论文核心解决复杂隐式个性化推理难题,提出课程驱动策略增强长行为历史推理能力。

研究机构
阿里巴巴集团
论文信息
作者 Yunyi Xuan, Hao Yi, Fengling Mao, Daye Cai, Leikun Liang et al.
发布日期 2026-05-09
arXiv ID 2605.08766
相关性评分 8/10 (高度相关)