摘要
随着 Agent 技能的快速增长,严格的评估对确保其在现实应用中的效用、质量和安全性至关重要。本文综述了超越基础技能创建的技能进化与评估全景,将进化划分为执行反馈、轨迹蒸馏、压缩和强化学习四种范式,阐释其如何提升技能可靠性。同时,文章分析了六大技能中心基准类别,指出覆盖缺口与权衡,并提出了构建通用、高效且可验证安全的技能生态系统的未来方向。
AI 推荐理由
论文核心聚焦于技能进化范式与评估框架,直接对应自我进化主题。
研究机构
Rutgers University
University of North Carolina at Charlotte
论文信息