摘要
计算机使用代理(CUA)依赖视觉 - 语言模型(VLM)将自然语言指令转化为图形界面操作,但现有系统通常固定使用单一模型,忽略了不同任务难度的差异。本文提出自适应 VLM 路由(AVR)框架,通过轻量级语义路由层,根据多模态嵌入估计动作难度并探测小模型置信度,动态将任务路由至满足可靠性阈值的最经济模型。结合记忆机制,该方法在保持高精度的同时显著降低推理成本,并统一了效率与安全性。
AI 推荐理由
论文核心研究 Agent 如何动态选择和路由工具调用(VLM 模型),属于技能学习与工具使用范畴。
研究机构
vLLM Semantic Router Project
MBZUAI
McGill University
AMD
Red Hat
论文信息