摘要
大型语言模型虽具备上下文学习能力,但在需长期适应反馈的在线决策场景中表现受限。本文研究连续潜在上下文令牌如何助力 Transformer 实现在线学习。通过构造常数深度 Transformer,利用少量潜在令牌以特征嵌入线性组合形式存储加权多数算法和 Q 学习的状态。实验表明,经多课程目标训练的模型在长序列预测中优于更大规模的模型。结果证实,连续潜在上下文为 Transformer 提供了实现在线学习算法的简洁有效持久状态。
AI 推荐理由
论文核心研究利用连续潜在上下文作为持久状态机制,实现高效在线学习与算法状态存储。
研究机构
Georgia Institute of Technology
University of California, Berkeley
Columbia University
论文信息