cold-start personalization multi-trajectory reasoning reinforcement learning
摘要

随着大语言模型的发展,个性化成为关键机制,但现有方法依赖密集交互历史,难以应对数据稀疏的冷启动场景。为此,本文提出 PAT(对齐轨迹个性化)框架。该框架首先沿两条互补轨迹检索信息:从风格相似用户获取写作风格线索,从偏好一致用户获取特定主题上下文。随后,采用基于强化学习的迭代双重推理机制,使模型能联合优化并整合这些信号。实验表明,PAT 在稀疏数据条件下显著提升了生成质量与对齐度。

AI 推荐理由

论文提出多轨迹推理框架解决冷启动个性化,核心贡献在于推理机制。

研究机构
Department of Computer Science, Vanderbilt University, Nashville, Tennessee University of Oregon, Eugene, Oregon
论文信息
作者 Bo Ni, Haowei Fu, Qinwen Ge, Franck Dernoncourt, Samyadeep Basu et al.
发布日期 2026-04-27
arXiv ID 2604.24996
相关性评分 9/10 (高度相关)