Agent Specialization Self-Improvement Data Synthesis Small Language Models
摘要

计算机使用代理(CUA)进展显著,但为每个软件领域部署大型专家模型成本高昂。小型开源代理虽具实用性,却存在领域特定失败不均的问题。本文提出 LearnWeak,一种无需标注的专业化框架,利用更强参考代理识别学生代理弱点,自动合成针对性任务并构建监督信号。该方法引入误差感知目标,解耦规划与执行错误,实现更精准的行为更新。实验表明,其在多个领域显著优于现有基线,强调了学生感知在数据合成与训练中的重要性。

AI 推荐理由

论文提出自动化框架,利用强代理识别弱点并合成数据以自我改进小代理,核心在于自我进化。

研究机构
KAIST Samsung Electronics DeepAuto.ai
论文信息
作者 Suji Kim, Kangsan Kim, Sung Ju Hwang
发布日期 2026-05-27
arXiv ID 2605.28775
相关性评分 9/10 (高度相关)