摘要
移动代理需自主执行用户指令,这要求具备涵盖屏幕摘要、子任务规划、动作决策及函数调用的混合能力推理。针对现有代理难以实现能力解耦增强与平衡整合的挑战,本文提出移动专家通道(CoME)架构。该架构包含四个专用专家,分别对应不同推理阶段,并通过面向输出的激活机制生成令牌。为赋予其混合推理能力,我们引入了渐进式训练策略:专家微调实现能力解耦与增强,路由微调对齐推理阶段,思维链微调促进多能力协作。此外,提出信息增益驱动的 DPO 以抑制错误传播,引导更具信息量的推理。实验表明 CoME 在 AITZ 和 AMEX 数据集上优于稠密模型及 MoE 方法。
AI 推荐理由
论文提出 CoME 架构,核心解决混合能力推理问题,通过专家机制和 Info-DPO 优化推理过程。
研究机构
1,2
2,3
2
1
论文信息