摘要
大型语言模型在处理超出上下文窗口的长文档时,需分块读取并更新记忆,但这引发了多轮训练中的时间信用分配难题。现有方法如“模型即裁判”存在计算开销大和噪声高的问题。为此,本文提出 TAMTRL 方法,利用相关文档作为教师信号,通过与每轮输入对齐并以自监督方式分配归一化概率奖励,为每次记忆更新提供细粒度学习信号。实验表明,该方法在多个长上下文基准测试中显著优于强基线,有效提升了长上下文处理能力。
AI 推荐理由
论文核心解决长上下文处理中的多轮记忆更新与时间信用分配问题,提出新型奖励重塑机制。
研究机构
北京航空航天大学人工智能学院
杭州国际创新研究院,浙江大学
论文信息