摘要
后训练量化虽能降低大推理模型的资源消耗,但会扭曲驱动自适应测试时计算分配的在线信号,导致有害的过早停止。本文研究了贪心 4 位推理中的这一问题,提出 BitCal-TTS,一种轻量级运行时控制器。该方法结合令牌级不确定性与推理轨迹稳定性的低成本代理、比特条件的置信度重缩放机制,以及面向结构化输出的比特感知后标记确认范围。实验表明,在 GSM8K 数据集上,该方法显著提升了 7B 和 14B 模型的精确匹配准确率,同时保持了相对于固定预算解码的令牌节省优势。
AI 推荐理由
论文针对量化推理模型的测试时计算分配,解决推理过程中的过早停止问题,核心提升推理准确性。
研究机构
Clarkson University
University of Massachusetts Boston
论文信息