摘要
通用代理需从经验中学习以泛化至不同任务与环境。针对上下文空间中存在的信用分配、过拟合及局部最优等挑战,本文提出反思性上下文学习(RCL)框架。该框架通过反复交互、行为反思及上下文迭代更新,将反思转化为类似梯度的方向信号,并利用变异机制优化未来行为。研究系统引入了批处理、失败回放等经典优化原语,在多个基准测试中显著优于强基线,证明上下文更新应被视为可系统性优化的问题。
AI 推荐理由
论文提出基于反思和迭代更新上下文的框架,核心在于代理的自我改进与自适应优化。
研究机构
Contextual AI
论文信息