mathematical reasoning policy optimization embedding mixing GRPO
摘要

大语言模型在数学推理上的成功高度依赖于展开阶段生成多样且有效的解题路径。然而,现有技术面临根本性权衡:词元级采样常产生仅重述不同的冗余轨迹,而利用随机噪声的嵌入级方法则易破坏语义一致性。为此,本文提出 N-GRPO,一种集成于组相对策略优化(GRPO)框架的新型探索策略。该方法利用语义邻居混合机制,通过混合锚点词元与其最近语义邻居的嵌入动态构建输入表示,在严格遵循局部语义流形的同时注入多样性。实验表明,N-GRPO 在不同规模的 DeepSeek-R1-Distill-Qwen 模型上,不仅在数学推理基准上持续优于强基线,且在分布外任务中展现出鲁棒的泛化能力。

AI 推荐理由

论文核心解决数学推理中的路径多样性问题,提出新策略显著提升推理基准表现。

研究机构
浙江大学 Ant Group
论文信息
作者 Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu
发布日期 2026-06-09
arXiv ID 2606.10768
相关性评分 9/10 (高度相关)