Claim Verification Reinforcement Learning Reasoning Traces Semi-Supervised Learning
摘要

主张验证领域存在端到端分类器准确但不可解释,与基于分解的方法可解释但性能较差的矛盾。本文提出 DecomposeRL,一种能生成可检查轨迹的高精度验证器。该方法将问题分解构建为强化学习策略,利用 GRPO 算法和多维度奖励集合,支持全监督及半监督学习。通过数据筛选漏斗,从 11.5 万条声明中提炼出 5000 条高密度信号样本,显著降低训练成本。实验表明,仅在 5000 条数据上训练的 7B 模型在多个基准测试中表现优异,媲美更大规模基线模型。

AI 推荐理由

论文核心是通过分解问题生成可追溯的推理链,属于典型的复杂推理任务研究。

研究机构
马里兰大学巴尔的摩郡分校计算机科学与电气工程系
论文信息
作者 Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro
发布日期 2026-05-27
arXiv ID 2605.27858
相关性评分 9/10 (高度相关)