摘要
本文提出 AliyunConsoleAgent,旨在解决真实云控制台中文档验证的高成本与低覆盖率问题。针对前沿模型成本高及隐私限制,作者设计了两阶段训练范式:首先基于蒸馏的前沿模型轨迹进行监督微调,随后利用群相对策略优化(GRPO)及双通道结果奖励模型在真实云环境中进行强化学习。通过构建高确定性 rollout 系统及基于后端审计日志的奖励评估协议,有效隔离环境噪声并防止奖励欺骗。实验表明,该模型显著缩小了与最强专有模型的差距,同时大幅降低推理成本,实现了从指令遵循到自主决策的进化。
AI 推荐理由
论文核心在于通过蒸馏和强化学习实现 Agent 从机械执行到自主决策的自我进化与能力跃升。
研究机构
Alibaba Cloud
论文信息