Device-Cloud Collaboration Long-Horizon Tasks Reinforcement Learning Agent Coordination
摘要

大型语言模型智能体擅长解决复杂长程任务,但面临设备端高效脆弱与云端强大昂贵的困境。现有路由机制仅在任务层面决策,难以适应多步交互的动态难度。本文提出 Hera,一种面向长程任务的步级设备 - 云协同协调器。该方法采用两阶段训练范式:首先通过模仿学习进行冷启动,将步级路由转化为监督分类问题;随后利用感知成本的强化学习联合优化任务成功率与云端使用效率。实验表明,Hera 在多个基准上显著优于 prior 方法,以仅 46.3% 的云端调用步骤实现了云端专属模型 92.5% 的成功率。

AI 推荐理由

论文核心解决长程任务中的多步规划协调问题,通过细粒度路由优化任务执行策略。

研究机构
复旦大学 阿里巴巴集团 深圳大学-比特大学 香港大学 纽约大学 马来亚大学
论文信息
作者 Yuxin Zhang, Mengxue Hu, Zheng Lin, Xiaoyi Fan, Fan Xie et al.
发布日期 2026-05-23
arXiv ID 2605.24598
相关性评分 9/10 (高度相关)