摘要
针对 GRPO 等在线强化学习方法存在的模式坍塌问题,即概率质量过度集中于单一解而停止探索,本文提出分布匹配策略优化(DMPO)。该方法通过近似最小化前向 KL 散度,构建基于奖励的轨迹目标分布并对齐策略分布,从而在训练中维持持续探索。在 NP 难组合优化及数学推理任务上的实验表明,DMPO 显著提升了方案多样性与求解质量,证明了保留多样性的训练能增强跨模态的通用推理能力。
AI 推荐理由
论文核心解决推理任务中的模式坍塌问题,通过分布匹配提升解的多样性与推理质量。
研究机构
上海人工智能实验室, 中国
论文信息