长上下文 上下文检索 推理增强 大语言模型
摘要

本文提出 RecaLLM,一种经后训练以有效利用长上下文信息的推理语言模型。针对推理步骤导致后续上下文检索性能下降的“思虑迷失”现象,该模型交替执行推理与显式上下文检索,以解决中间子问题所需的信息获取。引入低开销约束解码机制实现证据片段的原样复制,增强生成内容的依据性。在多样检索任务上训练后,RecaLLM 在 RULER 和 HELMET 基准测试中表现优异,且在仅用短样本训练的情况下,支持长达 128K 的上下文窗口,为无需昂贵长数据训练即可提升长上下文性能提供了新路径。

AI 推荐理由

论文核心解决推理过程中的信息丢失问题,通过交织检索与推理提升长上下文推理能力。

研究机构
University of Massachusetts Amherst
论文信息
作者 Kyle Whitecross, Negin Rahimi
发布日期 2026-04-10
arXiv ID 2604.09494
相关性评分 9/10 (高度相关)