Adaptive Reasoning Compute Efficiency LLM Optimization
摘要

大型推理模型常错误分配测试时计算资源。现有方法多基于感知难度压缩推理,却忽视可解性,导致在不可解问题上浪费资源或在难但可解问题上压缩过度。本文提出“预算高效思维”(BET)框架,将自适应推理建模为不确定性下的计算投资。结合行为冷启动与 GRPO 算法,BET 学会了三种策略:简洁回答简单问题、早期放弃低期望回报问题、为难但可解问题保留算力。实验表明,该方法在七个基准上平均减少 55% 推理 token 并提升性能,且具备零样本迁移能力。

AI 推荐理由

论文核心研究自适应推理中的计算预算分配机制,提出 BET 框架优化推理效率。

研究机构
University of Science and Technology of China The Chinese University of Hong Kong
论文信息
作者 Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin
发布日期 2026-05-12
arXiv ID 2605.11625
相关性评分 9/10 (高度相关)