Long-Context Reinforcement Learning Memory Update Credit Assignment
摘要

大型语言模型在处理超出上下文窗口的长文档时,需分块读取并更新记忆,但这引发了多轮训练中的时间信用分配难题。现有方法如“模型即裁判”存在计算开销大和噪声高的问题。为此,本文提出 TAMTRL 方法,利用相关文档作为教师信号,通过与每轮输入对齐并以自监督方式分配归一化概率奖励,为每次记忆更新提供细粒度学习信号。实验表明,该方法在多个长上下文基准测试中显著优于强基线,有效提升了长上下文处理能力。

AI 推荐理由

论文核心解决长上下文处理中的多轮记忆更新与时间信用分配问题,提出新型奖励重塑机制。

研究机构
北京航空航天大学人工智能学院 杭州国际创新研究院,浙江大学
论文信息
作者 Li Wang, Yandong Wang, Xin Yu, Kui Zhang, Tianhao Peng et al.
发布日期 2026-03-23
arXiv ID 2603.21663
相关性评分 9/10 (高度相关)