Reinforcement Learning Reasoning Reward Modeling GRPO
摘要

本文主张将奖励分解为加权且可验证的标准,并利用大语言模型作为评判者进行打分,从而提供部分信用优化信号。作者形式化了“基于评分标准的强化学习”框架,其中策略针对由冻结大语言模型生成的结构化多标准奖励进行优化。通过在约 10 万份科技文档衍生的评分标准上训练 Llama-3.1-8B-Instruct 模型,该方法在保留测试集上取得了显著成效,并在 GSM8K、MATH 等四个未见过的推理基准测试中优于基线模型,证明了结构化奖励能诱导可迁移的推理行为。

AI 推荐理由

论文核心提出基于评分标准的 RL 框架,旨在提升模型在数学及科学领域的通用推理能力。

研究机构
Los Alamos National Laboratory, Los Alamos, NM, USA
论文信息
作者 Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley
发布日期 2026-05-08
arXiv ID 2605.08061
相关性评分 9/10 (高度相关)