摘要
本文提出一种新颖方法,通过对冻结参考策略(如 SFT)与可训练策略的对数几率(logits)进行平均,并将其融入组相对策略优化(GRPO)。不同于基于可验证奖励的强化学习方法,该方案无需 KL 散度正则化或评论家模型。通过对数平均结构耦合可训练策略与参考锚点,既利用了可训练策略的推理专长,又保留了 SFT 的格式优势。在 MATH、cn-k12 和 MMLU 数据集上的评估表明,该方法准确率高于或至少媲美传统的 KL 正则化 GRPO。
AI 推荐理由
论文旨在提升 LLM 在数学等任务上的推理准确率,核心方法直接针对推理能力优化。
研究机构
中国
论文信息