摘要
推理大语言模型在解决新问题时,往往在漫长的中间推理轨迹(如思维链)上消耗大量令牌。本文提出总结并存储从广泛深思和试错探索中提炼出的可复用推理技能,并在推理阶段检索这些技能以指导后续推理。不同于主流的“从头推理”范式,该方法首先为每个查询召回相关技能,帮助模型避免冗余弯路并聚焦有效求解路径。在编码和数学推理任务上的评估表明,该方法显著减少了推理令牌用量,同时提升了整体性能,展现出巨大的实际应用与经济潜力。
AI 推荐理由
论文核心提出利用推理技能引导推理过程,直接优化推理效率与准确性。
研究机构
Qiyuan Tech
Tsinghua University
The University of Hong Kong
Peking University
论文信息