RLVR Math Reasoning Offline RL GRPO DPO
摘要

本文针对基于可验证奖励的强化学习(RLVR)计算成本高的问题,提出 G2D 三阶段流程:短期 GRPO 预热、构建静态偏好数据集及离线 DPO 微调。实验表明,适度预热产生的具有校准不确定性的 rollout 能提供更强的对比信号,使离线方法在大幅降低算力消耗的同时,于 MATH-500 等推理基准上超越纯在线 GRPO。研究指出离线与在线方法的差距主要源于数据信息量而非数量。

AI 推荐理由

论文聚焦 RLVR 范式提升 LLM 推理能力,核心解决数学推理任务中的训练效率与性能问题。

研究机构
TCS Research Department of CSE IIT Madras Chennai, India Department of Data Science & AI Wadhwani School of Data Science & AI
论文信息
作者 Richa Verma, Balaraman Ravindran
发布日期 2026-05-20
arXiv ID 2605.21266
相关性评分 9/10 (高度相关)