摘要
本文主张将奖励分解为加权且可验证的标准,并利用大语言模型作为评判者进行打分,从而提供部分信用优化信号。作者形式化了“基于评分标准的强化学习”框架,其中策略针对由冻结大语言模型生成的结构化多标准奖励进行优化。通过在约 10 万份科技文档衍生的评分标准上训练 Llama-3.1-8B-Instruct 模型,该方法在保留测试集上取得了显著成效,并在 GSM8K、MATH 等四个未见过的推理基准测试中优于基线模型,证明了结构化奖励能诱导可迁移的推理行为。
AI 推荐理由
论文核心提出基于评分标准的 RL 框架,旨在提升模型在数学及科学领域的通用推理能力。
研究机构
Los Alamos National Laboratory, Los Alamos, NM, USA
论文信息