摘要
近期生成式奖励模型(GRM)虽通过思维链(CoT)提升了大语言模型的推理能力,但存在对所有输入 indiscriminately 应用 CoT 导致计算冗余,以及依赖投票机制缺乏评估粒度两大局限。本文提出 E-GRM 框架,利用并行生成的收敛行为估计模型内部不确定性,仅在必要时触发 CoT 推理。此外,引入混合回归 - 排序目标训练的轻量级判别评分器,以提供细粒度的推理路径评估。实验表明,该方法在显著降低推理成本的同时持续提高了答案准确率。
AI 推荐理由
论文核心研究基于不确定性的选择性推理触发机制,直接优化 LLM 推理效率与质量。
研究机构
University of New South Wales, Australia
Tencent, China
Beijing Info. Sci. & Tech. Univ., China
Baidu, China
UESTC, China
论文信息