摘要
本文针对基于可验证奖励的强化学习(RLVR)计算成本高的问题,提出 G2D 三阶段流程:短期 GRPO 预热、构建静态偏好数据集及离线 DPO 微调。实验表明,适度预热产生的具有校准不确定性的 rollout 能提供更强的对比信号,使离线方法在大幅降低算力消耗的同时,于 MATH-500 等推理基准上超越纯在线 GRPO。研究指出离线与在线方法的差距主要源于数据信息量而非数量。
AI 推荐理由
论文聚焦 RLVR 范式提升 LLM 推理能力,核心解决数学推理任务中的训练效率与性能问题。
研究机构
TCS Research
Department of CSE
IIT Madras
Chennai, India
Department of Data Science & AI
Wadhwani School of Data Science & AI
论文信息