摘要
个性化问答要求答案既准确又符合用户背景与偏好。现有方法多直接利用查询检索个人文档,导致个性化流于表面。本文提出 PR2,一种融合个人上下文推理与检索的强化学习框架。PR2 学习自适应的检索 - 推理策略,决定何时检索、检索何种证据以及如何将其融入中间推理步骤。通过在个性化奖励函数下优化多轮推理轨迹,该框架强化了更契合用户偏好及上下文信号的推理路径。实验表明,PR2 在 LaMP-QA 基准上显著优于现有基线。
AI 推荐理由
论文核心提出结合推理与检索的强化学习框架,优化多步推理轨迹以解决个性化问答。
研究机构
华盛顿大学
马萨诸塞大学阿默斯特分校
论文信息