Claim Verification Reinforcement Learning Decomposition Structured Reasoning
摘要

复杂的声明验证需要将句子分解为可验证的子声明,但现有方法难以使分解质量与验证性能保持一致。本文提出一种强化学习方法,利用组相对策略优化(GRPO)联合优化分解质量与验证器对齐。该方法整合了结构化序列推理、基于教师蒸馏示例的监督微调,以及平衡格式合规性、验证器对齐和分解质量的多目标奖励机制。在六个评估设置中,训练的 8B 分解模型将下游验证性能提升至 71.75% 的宏平均 F1 分数,优于基于提示的方法和现有 RL 方法。人工评估证实了生成子声明的高质量。

AI 推荐理由

论文核心在于通过结构化序列推理和子句分解优化验证性能,属推理机制研究。

研究机构
牛津大学 JP Morgan AI Research
论文信息
作者 Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero et al.
发布日期 2026-02-25
arXiv ID 2602.21857
相关性评分 9/10 (高度相关)