Reinforcement Learning Personalized QA Intent Inference Reasoning Process
摘要

有效的个性化问答需基于用户隐含意图,但现有方法多依赖多轮对话或丰富画像,难以在单轮设置中显式建模意图。为此,本文提出意图感知个性化(IAP)框架,利用强化学习训练模型从单轮问题中直接推断隐含意图,并通过基于标签的模式将其融入思维步骤。该方法在个性化奖励函数下优化回答轨迹,使隐含意图显性化。实验表明,IAP 在 LaMP-QA 基准上显著优于基线模型,平均宏观得分提升约 7.5%。

AI 推荐理由

论文核心在于通过 RL 训练模型在推理步骤中显式推断并整合用户隐含意图。

研究机构
University of Washington, Seattle, WA, USA
论文信息
作者 Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West, Nicholas Weber
发布日期 2026-05-12
arXiv ID 2605.12645
相关性评分 8/10 (高度相关)