摘要
现有移动设备控制代理在处理需长程规划与精确操作的复杂任务时表现不佳,主要归因于缺乏相关经验或技能生疏。本文提出 K^2-Agent,一种模拟人类认知的分层框架,将声明性知识(知何事)与程序性知识(知何法)分离并协同进化。高层推理器通过单样本演示启动,运行“总结 - 反思 - 定位 - 修订”循环,经自我进化提炼任务知识;底层执行器采用课程引导的群组相对策略优化训练。在 AndroidWorld 基准测试中,该代理仅凭原始截图即达 76.1% 成功率,并展现出强大的双重泛化能力。
AI 推荐理由
论文核心提出声明性与程序性知识的协同进化机制,通过自进化循环优化任务规划与执行。
研究机构
中国科学院自动化研究所智能系统与机器人研究中心
清华大学计算机科学与技术系
论文信息