摘要
计算机使用代理(CUA)进展显著,但为每个软件领域部署大型专家模型成本高昂。小型开源代理虽具实用性,却存在领域特定失败不均的问题。本文提出 LearnWeak,一种无需标注的专业化框架,利用更强参考代理识别学生代理弱点,自动合成针对性任务并构建监督信号。该方法引入误差感知目标,解耦规划与执行错误,实现更精准的行为更新。实验表明,其在多个领域显著优于现有基线,强调了学生感知在数据合成与训练中的重要性。
AI 推荐理由
论文提出自动化框架,利用强代理识别弱点并合成数据以自我改进小代理,核心在于自我进化。
研究机构
KAIST
Samsung Electronics
DeepAuto.ai
论文信息