Reinforcement Learning Reasoning Logit Averaging GRPO Math Reasoning
摘要

本文提出一种新颖方法,通过对冻结参考策略(如 SFT)与可训练策略的对数几率(logits)进行平均,并将其融入组相对策略优化(GRPO)。不同于基于可验证奖励的强化学习方法,该方案无需 KL 散度正则化或评论家模型。通过对数平均结构耦合可训练策略与参考锚点,既利用了可训练策略的推理专长,又保留了 SFT 的格式优势。在 MATH、cn-k12 和 MMLU 数据集上的评估表明,该方法准确率高于或至少媲美传统的 KL 正则化 GRPO。

AI 推荐理由

论文旨在提升 LLM 在数学等任务上的推理准确率,核心方法直接针对推理能力优化。

研究机构
中国
论文信息
作者 Xingwei Gan, Ying Zhu
发布日期 2026-05-19
arXiv ID 2605.20555
相关性评分 9/10 (高度相关)