Reinforcement Learning Diverse Reasoning Mode Collapse Distribution Matching
摘要

针对 GRPO 等在线强化学习方法存在的模式坍塌问题,即概率质量过度集中于单一解而停止探索,本文提出分布匹配策略优化(DMPO)。该方法通过近似最小化前向 KL 散度,构建基于奖励的轨迹目标分布并对齐策略分布,从而在训练中维持持续探索。在 NP 难组合优化及数学推理任务上的实验表明,DMPO 显著提升了方案多样性与求解质量,证明了保留多样性的训练能增强跨模态的通用推理能力。

AI 推荐理由

论文核心解决推理任务中的模式坍塌问题,通过分布匹配提升解的多样性与推理质量。

研究机构
上海人工智能实验室, 中国
论文信息
作者 Xiaozhe Li, Yang Li, Xinyu Fang, Shengyuan Ding, Peiji Li et al.
发布日期 2026-05-19
arXiv ID 2605.19461
相关性评分 9/10 (高度相关)