摘要
近期大语言模型推动了密集推理范式的发展,但其长序列生成导致计算开销巨大。本文提出 Tandem,一种协同大模型(LLM)与小模型(SLM)的新框架,以显著降低计算成本并保持高质量推理。在该框架中,LLM 作为战略协调者生成关键推理洞察,指导高效的 SLM 执行完整推理过程。此外,Tandem 引入成本感知终止机制,自适应决定何时停止 LLM 生成以平衡效率与可靠性。实验表明,该方法在数学推理和代码生成任务中较独立 LLM 推理降低成本约 40%,且性能优越或具有竞争力。
AI 推荐理由
论文核心提出大小模型协同框架,旨在优化逐步推理过程的效率与质量。
研究机构
City University of Hong Kong
Tencent Jarvis Lab
Renmin University of China
Westlake University
论文信息