online learning latent context transformer architecture persistent state
摘要

大型语言模型虽具备上下文学习能力,但在需长期适应反馈的在线决策场景中表现受限。本文研究连续潜在上下文令牌如何助力 Transformer 实现在线学习。通过构造常数深度 Transformer,利用少量潜在令牌以特征嵌入线性组合形式存储加权多数算法和 Q 学习的状态。实验表明,经多课程目标训练的模型在长序列预测中优于更大规模的模型。结果证实,连续潜在上下文为 Transformer 提供了实现在线学习算法的简洁有效持久状态。

AI 推荐理由

论文核心研究利用连续潜在上下文作为持久状态机制,实现高效在线学习与算法状态存储。

研究机构
Georgia Institute of Technology University of California, Berkeley Columbia University
论文信息
作者 Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia
发布日期 2026-05-11
arXiv ID 2605.09867
相关性评分 9/10 (高度相关)