Skill Evolution Evaluation Framework Agent Benchmarks Survey
摘要

随着 Agent 技能的快速增长,严格的评估对确保其在现实应用中的效用、质量和安全性至关重要。本文综述了超越基础技能创建的技能进化与评估全景,将进化划分为执行反馈、轨迹蒸馏、压缩和强化学习四种范式,阐释其如何提升技能可靠性。同时,文章分析了六大技能中心基准类别,指出覆盖缺口与权衡,并提出了构建通用、高效且可验证安全的技能生态系统的未来方向。

AI 推荐理由

论文核心聚焦于技能进化范式与评估框架,直接对应自我进化主题。

研究机构
Rutgers University University of North Carolina at Charlotte
论文信息
作者 Kexin Ding, Yang Zhou, Can Jin, Feng Tong, Mu Zhou et al.
发布日期 2026-06-09
arXiv ID 2606.11435
相关性评分 9/10 (高度相关)