摘要
本文提出了一种用于自主多模态查询处理的智能体框架,旨在协调跨文本、图像、音频、视频及文档的专用工具。中央监督器动态分解用户查询,将子任务委托给适配的工具(如目标检测、OCR、语音转录),并通过自适应路由策略而非预定义决策树合成结果。在 15 类任务的 2847 个查询评估中,该框架在保持准确率的同时,显著降低了响应时间、对话返工率及成本,证明了智能集中式编排对多模态 AI 部署经济性的根本提升。
AI 推荐理由
论文核心研究多模态工具的智能编排、动态分解与自适应路由,属于技能学习范畴。
研究机构
PwC US
论文信息