摘要
大型语言模型的个性化面临挑战,现有方法依赖昂贵的下游任务标注来生成用户画像(记忆)。本文提出 BUMP 框架,通过自监督方式训练画像生成器,无需任何下游标签。该方法利用 GRPO 算法和双向批次排序目标,衡量生成画像与用户持有交互之间的相互排名能力,仅凭原始交互日志即可提供密集奖励。在 LaMP 基准测试中,BUMP 的表现匹配或优于依赖标注奖励的闭源 API 及先前方法。
AI 推荐理由
论文核心研究用户交互历史到自然语言记忆(Profile)的自监督生成机制,属于典型的记忆架构研究。
研究机构
Snap Inc.
论文信息