摘要
针对轻量级端侧视觉语言 GUI 智能体受限于模型容量的问题,本文提出一种无需监督微调的新范式。通过引导式在线策略蒸馏整合广义知识,结合动态检索减少幻觉;进一步引入多解双层 GRPO 框架,协同对齐宏观子任务规划与微观执行匹配,增强长程场景探索。实验表明,该方法在轻量模型中达到最先进水平,充分释放了小规模智能体的潜力。
AI 推荐理由
论文提出双层 GRPO 框架,核心在于对齐宏观子任务规划与微观执行,显著提升长程任务规划能力。
研究机构
Moore Threads AI
论文信息