摘要
本文提出 RecaLLM,一种经后训练以有效利用长上下文信息的推理语言模型。针对推理步骤导致后续上下文检索性能下降的“思虑迷失”现象,该模型交替执行推理与显式上下文检索,以解决中间子问题所需的信息获取。引入低开销约束解码机制实现证据片段的原样复制,增强生成内容的依据性。在多样检索任务上训练后,RecaLLM 在 RULER 和 HELMET 基准测试中表现优异,且在仅用短样本训练的情况下,支持长达 128K 的上下文窗口,为无需昂贵长数据训练即可提升长上下文性能提供了新路径。
AI 推荐理由
论文核心解决推理过程中的信息丢失问题,通过交织检索与推理提升长上下文推理能力。
研究机构
University of Massachusetts Amherst
论文信息