摘要
组相对策略优化(GRPO)虽增强了大语言模型的推理能力,但常导致过度自信,降低相对校准度。现有方法难以兼顾校准与准确率。本文证明该缺陷源于忽略不确定性的优势估计,并提出校准感知策略优化(CAPO)。CAPO 采用理论一致的逻辑 AUC 代理损失及噪声掩码机制,实现不确定性感知的优势估计。实验表明,CAPO 在多个数学推理基准上显著改善校准度达 15%,同时保持或提升准确率,并在低置信度弃权时实现帕累托最优的精度 - 覆盖率权衡。
AI 推荐理由
论文核心针对推理 LLM 的校准问题,提出新优化算法显著提升数学推理能力与置信度一致性。
研究机构
国家关键领域人工智能创新平台认知与决策智能复杂系统实验室
中国科学院自动化研究所
北京国家人工智能中心信息科学与技术研究院,清华大学
论文信息