摘要
针对复杂上下文学习缺乏外部反馈与人工标注成本高的问题,本文提出 Ctx2Skill,一种无需人工监督的自进化框架。该框架利用多智能体自博弈循环,包含挑战者、推理者与裁判,通过对抗生成任务与二元反馈驱动技能演化。引入跨时重放机制防止对抗崩溃,确保技能的鲁棒性与泛化性。实验表明,该方法在多个任务上显著提升了模型的上下文学习能力。
AI 推荐理由
论文提出自进化框架 Ctx2Skill,核心在于无监督下的技能自主发现、优化与选择机制。
研究机构
THU
DeepLing AI
UUC
FDU
CUHK
论文信息