摘要
可验证奖励的强化学习(RLVR)虽能提升大语言模型在数学等领域的推理能力,但依赖手工规则限制了其在答案多变的通用推理领域的应用。为此,本文提出条件期望奖励(CER),利用大语言模型自身作为隐式验证器,无需外部规则或辅助模型。CER 通过计算生成答案条件下参考答案的期望似然,提供反映正确程度的软奖励信号。实验表明,CER 在数学及通用推理任务中均表现优异,是一种灵活通用的验证机制。
AI 推荐理由
论文提出 CER 方法,旨在解决通用领域的推理验证难题,显著提升 LLM 推理能力。
研究机构
Fudan University
论文信息