Reinforcement Learning Reasoning Exploration Prompt Perturbation GRPO
摘要

基于可验证奖励的强化学习(如 GRPO)显著提升了大语言模型的推理能力,但在复杂任务中常受困于“零优势问题”,导致训练信号丢失。本文提出洛伦兹扰动探索(LoPE)框架,通过在提示前随机添加无意义的拉丁文序列,扰动输出分布以解锁正交推理路径。实验表明,该方法在多种模型规模下均显著优于原始重采样策略,有效拓宽了强化学习中的推理探索范围,为提升模型解决难题的能力提供了强基线。

AI 推荐理由

论文核心解决复杂推理任务中的探索瓶颈,通过扰动提升推理能力。

研究机构
华盛顿大学圣路易斯分校
论文信息
作者 Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang et al.
发布日期 2026-05-07
arXiv ID 2605.05566
相关性评分 9/10 (高度相关)