Reinforcement Learning Agent Orchestration Model Ensemble Hierarchical Planning
摘要

针对现有框架依赖单一模型和固定逻辑的瓶颈,本文提出 Maestro,一种基于强化学习的编排框架。该方法将多模态任务重构为分层模型 - 技能注册表上的序列决策过程,训练轻量级策略动态组合冻结的专家模型与双层技能库。策略通过基于结果的强化学习优化,无需步骤级监督。实验表明,Maestro 在十个基准测试中平均准确率达 70.1%,超越 GPT-5 等基线,且具备优异的泛化能力与计算效率。

AI 推荐理由

论文核心在于通过 RL 训练策略动态规划模型与技能的组合序列,属于高阶任务规划。

研究机构
清华大学 浙江大学 香港中文大学 南京理工大学
论文信息
作者 Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu et al.
发布日期 2026-05-21
arXiv ID 2605.22177
相关性评分 9/10 (高度相关)