Generative Reward Model Chain-of-Thought Uncertainty Estimation Efficient Inference
摘要

近期生成式奖励模型(GRM)虽通过思维链(CoT)提升了大语言模型的推理能力,但存在对所有输入 indiscriminately 应用 CoT 导致计算冗余,以及依赖投票机制缺乏评估粒度两大局限。本文提出 E-GRM 框架,利用并行生成的收敛行为估计模型内部不确定性,仅在必要时触发 CoT 推理。此外,引入混合回归 - 排序目标训练的轻量级判别评分器,以提供细粒度的推理路径评估。实验表明,该方法在显著降低推理成本的同时持续提高了答案准确率。

AI 推荐理由

论文核心研究基于不确定性的选择性推理触发机制,直接优化 LLM 推理效率与质量。

研究机构
University of New South Wales, Australia Tencent, China Beijing Info. Sci. & Tech. Univ., China Baidu, China UESTC, China
论文信息
作者 Chao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han et al.
发布日期 2026-04-11
arXiv ID 2604.10072
相关性评分 9/10 (高度相关)