RLVR Calibration Reasoning Gradient Conflict
摘要

可验证奖励的强化学习(RLVR)显著增强了大语言模型的推理能力,但深受校准退化困扰,导致模型对错误答案过度自信。现有研究试图直接将校准目标纳入优化,但本文理论分析表明,最大化策略准确率与最小化校准误差之间存在根本性的梯度冲突。基于此,我们提出了 DCPO 框架,系统性地解耦了推理与校准目标。实验证明,DCPO 在保持与 GRPO 相当准确率的同时,实现了最佳的校准性能,大幅缓解了过度自信问题,为更可靠的 LLM 部署提供了实用方案。

AI 推荐理由

论文核心解决 RLVR 中推理能力的校准退化问题,提出解耦框架以提升推理可靠性。

研究机构
中国科学院自动化研究所 清华大学
论文信息
作者 Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin et al.
发布日期 2026-03-10
arXiv ID 2603.09117
相关性评分 9/10 (高度相关)