Self-Evolution Skill Optimization LLM Agents GRPO
摘要

本文提出 Skills-Coach,一种旨在显著增强大语言模型代理技能自我进化的自动化框架。针对当前技能生态系统的碎片化问题,该框架通过多样化任务生成、轻量级优化、对比执行及可追踪评估四个核心模块,系统性地探索并优化技能提示与代码。实验引入包含 48 种技能的 Skill-X 基准数据集,结果表明该方法在多种技能类别中均实现了显著的性能提升,为构建更鲁棒、自适应的 LLM 代理提供了新途径。

AI 推荐理由

论文核心提出自我进化框架,利用无训练 GRPO 优化技能,直接对应自我进化主题。

研究机构
中国科学院大学 华东师范大学 东南大学 海南大学
论文信息
作者 Yu Tian, Jiawei Chen, Lifan Zheng, Mingxiang Tao, Xinyi Zeng et al.
发布日期 2026-04-30
arXiv ID 2604.27488
相关性评分 9/10 (高度相关)