摘要
本文研究了 Transformer 执行上下文强化学习(ICRL)的能力,即模型无需更新参数即可从轨迹数据中推断并执行学习算法。研究证明,线性自注意力模块可通过显式参数构造实现半梯度 SARSA 和 Actor-Critic 等策略改进方法。此外,文章设计了教师模仿训练过程,分析了梯度流动力学,并建立了 ICRL 领域首个收敛保证。实验表明,在随机生成的表格 MDP 上训练的 Transformer 能恢复理论预测的参数结构,并在未见环境中展现出强大的上下文控制性能,揭示了架构内部化经典 RL 算法的机制。
AI 推荐理由
论文证明 Transformer 能在上下文执行强化学习策略改进,实现无参数更新的自我进化。
研究机构
加利福尼亚大学戴维斯分校电子与计算机工程系
论文信息