Evidence Highlighting Long-context Reasoning Reinforcement Learning Frozen LLM
摘要

大语言模型虽具备推理能力,但在长且嘈杂的上下文中常遗漏关键证据。本文提出 HiLight 框架,将证据选择与推理解耦。该方法训练轻量级“强调智能体”在原始上下文中插入高亮标签,避免压缩或重写输入导致的信息失真,随后由冻结的求解器进行推理。通过强化学习利用任务奖励优化智能体,无需证据标注。实验表明,该方法在推荐和问答任务中显著优于基线,且策略可零样本迁移至不同规模的求解器。

AI 推荐理由

论文核心解决长上下文噪声中证据缺失导致的推理失败问题,通过高亮机制直接提升推理效果。

研究机构
Stony Brook University Meta AI
论文信息
作者 Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei et al.
发布日期 2026-04-24
arXiv ID 2604.22565
相关性评分 9/10 (高度相关)