Dynamic Collaboration Multi-step Reasoning SLM-LLM Synergy
摘要

大型语言模型(LLM)能力强大但存在成本与隐私隐患,小型语言模型(SLM)虽高效私密却能力受限。为此,本文提出一种动态协作框架:SLM 学习在多步推理中主动决定何时请求 LLM 协助,而 LLM 则提供自适应反馈而非被动工具。研究系统探讨了模型能力、效率及隐私约束对协作策略的影响。评估显示显著的缩放效应:更强的 SLM 更自主,更强的 LLM 使交互更少且信息量更大。该动态策略显著优于静态流水线及独立推理,并能鲁棒地迁移至未见过的 LLM。

AI 推荐理由

论文核心研究多步推理中的动态协作机制,小模型主动决策请求大模型辅助推理。

研究机构
Shanghai Jiao Tong University
论文信息
作者 Hang Zeng, Xiangyu Liu, Yong Hu, Chaoyue Niu, Jiarui Zhang et al.
发布日期 2026-04-20
arXiv ID 2604.17827
相关性评分 9/10 (高度相关)