摘要
可验证奖励的强化学习(RLVR)显著增强了大语言模型的推理能力,但深受校准退化困扰,导致模型对错误答案过度自信。现有研究试图直接将校准目标纳入优化,但本文理论分析表明,最大化策略准确率与最小化校准误差之间存在根本性的梯度冲突。基于此,我们提出了 DCPO 框架,系统性地解耦了推理与校准目标。实验证明,DCPO 在保持与 GRPO 相当准确率的同时,实现了最佳的校准性能,大幅缓解了过度自信问题,为更可靠的 LLM 部署提供了实用方案。
AI 推荐理由
论文核心解决 RLVR 中推理能力的校准退化问题,提出解耦框架以提升推理可靠性。
研究机构
中国科学院自动化研究所
清华大学
论文信息