摘要
复杂的声明验证需要将句子分解为可验证的子声明,但现有方法难以使分解质量与验证性能保持一致。本文提出一种强化学习方法,利用组相对策略优化(GRPO)联合优化分解质量与验证器对齐。该方法整合了结构化序列推理、基于教师蒸馏示例的监督微调,以及平衡格式合规性、验证器对齐和分解质量的多目标奖励机制。在六个评估设置中,训练的 8B 分解模型将下游验证性能提升至 71.75% 的宏平均 F1 分数,优于基于提示的方法和现有 RL 方法。人工评估证实了生成子声明的高质量。
AI 推荐理由
论文核心在于通过结构化序列推理和子句分解优化验证性能,属推理机制研究。
研究机构
牛津大学
JP Morgan AI Research
论文信息