摘要
过程奖励模型(PRM)能为大语言模型的推理提供步级反馈,但现有数据集构建成本高且局限于数学领域。本文提出一种基于规划领域定义语言(PDDL)的可扩展 PRM 数据集生成方法,构建了包含约一百万个推理步骤的语料库。实验表明,将 PDDL 衍生数据融入训练集,显著提升了模型在数学及非数学领域的推理表现。研究证实,规划问题是生成鲁棒、精细粒度训练数据的有效资源,突破了传统数学源的局限。
AI 推荐理由
论文核心是利用规划问题生成数据以训练过程奖励模型,旨在提升 LLM 的逐步推理能力。
研究机构
Babelscape
Babelscape & Sapienza University of Rome
论文信息