摘要
近期关于大语言模型(LLM)推理时测试阶段扩展的研究通常假设增加推理计算时间能均匀提升正确性。然而,已有研究表明推理不确定性高度局部化:一小部分低置信度的token显著导致推理错误和不必要的输出扩展。受此启发,本文提出一种基于置信度的对比解码方法——Thinking by Subtraction,通过在解码过程中检测并选择性干预低置信度token来提高推理可靠性。该方法通过用最小占位符替换高置信度token构建对比参考,并在低置信度位置减去该参考分布以优化预测结果。实验表明,CCD在数学推理基准上显著提升了准确性,同时大幅减少了输出长度,且KV缓存开销极小。作为一种无需训练的方法,CCD通过有针对性的低置信度干预提高了推理可靠性,避免了计算冗余。
AI 推荐理由
论文聚焦于提升LLM推理可靠性,提出针对性的低置信度干预方法,直接关联推理能力。
研究机构
北京大学
论文信息