Process Reward Models Reasoning PDDL Data Generation
摘要

过程奖励模型(PRM)能为大语言模型的推理提供步级反馈,但现有数据集构建成本高且局限于数学领域。本文提出一种基于规划领域定义语言(PDDL)的可扩展 PRM 数据集生成方法,构建了包含约一百万个推理步骤的语料库。实验表明,将 PDDL 衍生数据融入训练集,显著提升了模型在数学及非数学领域的推理表现。研究证实,规划问题是生成鲁棒、精细粒度训练数据的有效资源,突破了传统数学源的局限。

AI 推荐理由

论文核心是利用规划问题生成数据以训练过程奖励模型,旨在提升 LLM 的逐步推理能力。

研究机构
Babelscape Babelscape & Sapienza University of Rome
论文信息
作者 Raffaele Pisano, Roberto Navigli
发布日期 2026-04-20
arXiv ID 2604.17957
相关性评分 9/10 (高度相关)