摘要
本文探讨了具备推理能力的大语言模型作为自动评判者时的效益与成本。研究表明,显式推理能显著提升结构化验证任务(如数学和代码)的准确性,但在简单评估中增益有限且计算成本高昂。为此,作者提出鲁棒自适应成本高效路由(RACER)框架,将路由建模为约束分布鲁棒优化问题,动态选择推理或非推理评判者。该方法通过 KL 散度不确定性集应对分布偏移,具备理论收敛保证,并在实验中实现了优异的精度 - 成本权衡。
AI 推荐理由
论文核心研究推理模型在评判任务中的效能与成本,并提出自适应路由机制以优化推理资源分配。
研究机构
Department of Statistics, University of California, Irvine, USA
论文信息