collaborative inference efficiency optimization large-small model synergy
摘要

近期大语言模型推动了密集推理范式的发展,但其长序列生成导致计算开销巨大。本文提出 Tandem,一种协同大模型(LLM)与小模型(SLM)的新框架,以显著降低计算成本并保持高质量推理。在该框架中,LLM 作为战略协调者生成关键推理洞察,指导高效的 SLM 执行完整推理过程。此外,Tandem 引入成本感知终止机制,自适应决定何时停止 LLM 生成以平衡效率与可靠性。实验表明,该方法在数学推理和代码生成任务中较独立 LLM 推理降低成本约 40%,且性能优越或具有竞争力。

AI 推荐理由

论文核心提出大小模型协同框架,旨在优化逐步推理过程的效率与质量。

研究机构
City University of Hong Kong Tencent Jarvis Lab Renmin University of China Westlake University
论文信息
作者 Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen et al.
发布日期 2026-04-26
arXiv ID 2604.23623
相关性评分 9/10 (高度相关)