self-evolution context learning multi-agent skill discovery
摘要

针对复杂上下文学习缺乏外部反馈与人工标注成本高的问题,本文提出 Ctx2Skill,一种无需人工监督的自进化框架。该框架利用多智能体自博弈循环,包含挑战者、推理者与裁判,通过对抗生成任务与二元反馈驱动技能演化。引入跨时重放机制防止对抗崩溃,确保技能的鲁棒性与泛化性。实验表明,该方法在多个任务上显著提升了模型的上下文学习能力。

AI 推荐理由

论文提出自进化框架 Ctx2Skill,核心在于无监督下的技能自主发现、优化与选择机制。

研究机构
THU DeepLing AI UUC FDU CUHK
论文信息
作者 Shuzheng Si, Haozhe Zhao, Yu Lei, Qingyi Wang, Dingwei Chen et al.
发布日期 2026-04-30
arXiv ID 2604.27660
相关性评分 9/10 (高度相关)