摘要
针对现有框架依赖单一模型和固定逻辑的瓶颈,本文提出 Maestro,一种基于强化学习的编排框架。该方法将多模态任务重构为分层模型 - 技能注册表上的序列决策过程,训练轻量级策略动态组合冻结的专家模型与双层技能库。策略通过基于结果的强化学习优化,无需步骤级监督。实验表明,Maestro 在十个基准测试中平均准确率达 70.1%,超越 GPT-5 等基线,且具备优异的泛化能力与计算效率。
AI 推荐理由
论文核心在于通过 RL 训练策略动态规划模型与技能的组合序列,属于高阶任务规划。
研究机构
清华大学
浙江大学
香港中文大学
南京理工大学
论文信息