摘要
大型推理模型常错误分配测试时计算资源。现有方法多基于感知难度压缩推理,却忽视可解性,导致在不可解问题上浪费资源或在难但可解问题上压缩过度。本文提出“预算高效思维”(BET)框架,将自适应推理建模为不确定性下的计算投资。结合行为冷启动与 GRPO 算法,BET 学会了三种策略:简洁回答简单问题、早期放弃低期望回报问题、为难但可解问题保留算力。实验表明,该方法在七个基准上平均减少 55% 推理 token 并提升性能,且具备零样本迁移能力。
AI 推荐理由
论文核心研究自适应推理中的计算预算分配机制,提出 BET 框架优化推理效率。
研究机构
University of Science and Technology of China
The Chinese University of Hong Kong
论文信息