摘要
群组相对策略优化(GRPO)依赖组内滚动的多样性,而连续潜在推理模型因确定性导致轨迹雷同,致使 GRPO 失效。本文提出通过结构化 Dropout 引入必要随机性:在单次滚动中保持伯努利掩码恒定,生成轨迹方差,使各滚动视为变分分布的后验样本。理论证明该方法具有无偏性及梯度良定义性。在 GSM8K 基准上,该方法将 Coconut 基线通过率从 27.29% 提升至 29.01%,验证了其在潜在推理模型后训练中的有效性。
AI 推荐理由
论文核心解决连续潜在空间中的推理随机性问题,直接提升 LLM 推理能力。
研究机构
加利福尼亚大学圣迭戈分校电气与计算机工程系
论文信息