摘要
大型语言模型(LLM)虽具备卓越的推理能力,但成本高昂。本文提出 COREA 系统,通过级联小型语言模型(SLM)与 LLM,在复杂推理任务中平衡准确率与成本。该系统首先利用 SLM 生成答案及 verbalized 置信度评分,仅当置信度低于阈值时才调用 LLM 进行修正。我们引入基于强化学习的训练算法,通过额外的置信度校准奖励对齐 SLM 的置信度。实验表明,该方法显著提升了 SLM 的推理能力及置信度校准水平。相比单独使用 LLM,COREA 在域外数学及非数学数据集上分别降低了 21.5% 和 16.8% 的成本,而通过率下降不超过 2%。
AI 推荐理由
论文核心提出大小模型协作框架,旨在优化复杂推理任务的成本与准确率平衡。
研究机构
亚马逊网络服务
清华大学
论文信息