摘要
大型推理模型依赖长推理链导致推理成本高昂。虽然低比特量化可降低单 token 解码成本,但激进的 2 比特推理常因生成过程不稳定(如重复循环、预算耗尽)导致总 token 数激增,反而无法实现端到端加速。本文分析了 Qwen3 模型在数学和常识基准上的完整推理轨迹,发现精度下降与这些过程级故障紧密相关。为此,提出两种轻量级控制策略:FP16 规划(提供高精度大纲)和循环救援(检测并纠正重复轨迹)。实验表明,该方法显著恢复了 2 比特推理的精度并保持了速度优势。
AI 推荐理由
论文核心研究低比特量化下推理模型的失败模式及恢复机制,直接针对推理过程。
研究机构
BRAin Lab, Moscow, Russia
论文信息