Cost-Effective Reasoning Model Routing Chain-of-Thought Reinforcement Learning
摘要

推理时计算显著提升了大语言模型在复杂推理任务上的表现,但伴随高昂成本。现有方法多依赖手工设计的路由策略或训练大型过程奖励模型,存在局限性。本文将逐步模型路由建模为约束决策问题,利用强化学习训练小型控制策略,并结合阈值校准以平衡性能与效率。在三个数学基准测试上的实验表明,该方法在准确率与成本的权衡上优于手工策略,且媲美需训练大型奖励模型的方法。

AI 推荐理由

论文核心解决高成本推理问题,通过动态路由优化思维链过程,直接提升推理效率与性能。

研究机构
Department of Computer and Information Science, University of Pennsylvania
论文信息
作者 Wenwen Si, Insup Lee, Osbert Bastani
发布日期 2026-05-07
arXiv ID 2605.06116
相关性评分 9/10 (高度相关)