Reinforcement Learning Reasoning Reward Modeling LLM Alignment
摘要

可验证奖励的强化学习(RLVR)虽能提升大语言模型在数学等领域的推理能力,但依赖手工规则限制了其在答案多变的通用推理领域的应用。为此,本文提出条件期望奖励(CER),利用大语言模型自身作为隐式验证器,无需外部规则或辅助模型。CER 通过计算生成答案条件下参考答案的期望似然,提供反映正确程度的软奖励信号。实验表明,CER 在数学及通用推理任务中均表现优异,是一种灵活通用的验证机制。

AI 推荐理由

论文提出 CER 方法,旨在解决通用领域的推理验证难题,显著提升 LLM 推理能力。

研究机构
Fudan University
论文信息
作者 Changyi Xiao, Caijun Xu, Yixin Cao
发布日期 2026-03-11
arXiv ID 2603.10624
相关性评分 9/10 (高度相关)