Speculative Decoding Multimodal Agents System Optimization Parallel Execution
摘要

针对代理式多模态大语言模型因串行感知、推理及工具调用循环导致的高延迟问题,本文提出 SpecEyes 框架。该方法利用轻量级无工具模型作为推测性规划器,预测执行轨迹以实现昂贵工具链的早期终止。此外,引入基于答案可分离性的认知门控机制进行自验证,并设计异构并行漏斗以最大化系统吞吐量。实验表明,该方法在保持或提升精度的同时,显著降低了延迟并提高了并发处理能力。

AI 推荐理由

提出推测性规划框架,核心在于预测执行轨迹以加速多模态智能体。

研究机构
厦门大学 俄亥俄州立大学
论文信息
作者 Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji et al.
发布日期 2026-03-24
arXiv ID 2603.23483
相关性评分 9/10 (高度相关)