RLVR Mathematical Reasoning Diversity Policy Optimization
摘要

可验证奖励强化学习(RLVR)虽提升了推理任务的单次准确率,却常导致多采样覆盖率下降及多样性坍塌。本文指出其结构性成因:现有目标函数忽视正确解间的概率分布,致使概率质量集中于狭窄子集。为此,作者形式化了坍塌机制,并提出均匀正确策略优化(UCPO)。该方法在 GRPO 基础上引入条件均匀性惩罚,重分配梯度信号以鼓励正确解集内的均匀概率分布。实验表明,UCPO 在保持高准确率的同时,显著提升了数学推理基准测试中的 Pass@K 指标与解的多样性。

AI 推荐理由

论文针对数学推理任务,提出优化策略以解决多样性坍塌问题,显著提升推理覆盖率。

研究机构
普渡大学西拉法叶分校计算机科学系
论文信息
作者 Anamika Lochab, Bolian Li, Ruqi Zhang
发布日期 2026-05-01
arXiv ID 2605.00365
相关性评分 9/10 (高度相关)