Tool Calling Speculative Decoding Latency Optimization Schema-Aware
摘要

工具调用极大扩展了大语言模型的实际效用,但复杂任务中的多步交互导致显著延迟。本文提出 ToolSpec,一种模式感知且检索增强的推测解码方法。该方法利用预定义工具模式生成准确草稿,通过有限状态机交替进行确定性填充与变量推测;同时检索相似历史调用复用为草稿。实验表明,ToolSpec 可实现高达 4.2 倍加速,显著优于现有无训练推测解码方法,是即插即用的高效解决方案。

AI 推荐理由

论文核心解决工具调用延迟问题,通过优化调用机制直接提升 Agent 技能执行效率。

研究机构
香港理工大学计算机学院
论文信息
作者 Heming Xia, Yongqi Li, Cunxiao Du, Mingbo Song, Wenjie Li
发布日期 2026-04-15
arXiv ID 2604.13519
相关性评分 9/10 (高度相关)