摘要
利用强化学习扩展测试时计算是提升大语言模型推理能力的有效途径,但基于结果的奖励常导致模型过度自信,引发幻觉及资源分配不当。本文提出置信度边界强化学习(RLCM),这是一种感知校准的框架,通过在中间预算完成项上应用增强边界的流程奖励,联合优化正确性与置信度可靠性。该方法鼓励在单一推理轨迹中拉大正确与错误步骤间的置信度差距。实验表明,RLCM 在数学、代码、逻辑及科学基准上显著改善了校准度,同时保持或提升了准确率,并支持更高效的风险控制与加权聚合。
AI 推荐理由
论文核心在于通过置信度边界优化 LLM 推理过程的校准与准确性,直接提升推理能力。
研究机构
约翰霍普金斯大学
论文信息