Chain-of-Thought Efficient Reasoning Token Efficiency Task-Scaling Law
摘要

大型语言模型利用思维链推理虽性能优异,但令牌消耗巨大导致成本高昂。现有优化方法往往牺牲推理质量或需复杂训练流程。本文提出“批处理上下文强化”(BCR),一种极简的单阶段训练范式,通过在共享上下文中同时解决多个问题并基于实例准确率奖励,隐式构建令牌预算。研究发现新的任务缩放定律:增加并发问题数可显著降低单题令牌用量且精度下降平缓。实验表明,BCR 在多个数学基准上减少了 15.8% 至 62.6% 的令牌使用,同时保持或提升了准确性,实现了无需显式长度监督的自我调节高效推理。

AI 推荐理由

论文核心研究通过新训练范式提升 LLM 的推理效率与思维链质量,直接针对推理机制。

研究机构
University of Illinois Urbana-Champaign
论文信息
作者 Bangji Yang, Hongbo Ma, Jiajun Fan, Ge Liu
发布日期 2026-04-02
arXiv ID 2604.02322
相关性评分 9/10 (高度相关)