摘要
主张验证领域存在端到端分类器准确但不可解释,与基于分解的方法可解释但性能较差的矛盾。本文提出 DecomposeRL,一种能生成可检查轨迹的高精度验证器。该方法将问题分解构建为强化学习策略,利用 GRPO 算法和多维度奖励集合,支持全监督及半监督学习。通过数据筛选漏斗,从 11.5 万条声明中提炼出 5000 条高密度信号样本,显著降低训练成本。实验表明,仅在 5000 条数据上训练的 7B 模型在多个基准测试中表现优异,媲美更大规模基线模型。
AI 推荐理由
论文核心是通过分解问题生成可追溯的推理链,属于典型的复杂推理任务研究。
研究机构
马里兰大学巴尔的摩郡分校计算机科学与电气工程系
论文信息