摘要
大语言模型虽具备推理能力,但在长且嘈杂的上下文中常遗漏关键证据。本文提出 HiLight 框架,将证据选择与推理解耦。该方法训练轻量级“强调智能体”在原始上下文中插入高亮标签,避免压缩或重写输入导致的信息失真,随后由冻结的求解器进行推理。通过强化学习利用任务奖励优化智能体,无需证据标注。实验表明,该方法在推荐和问答任务中显著优于基线,且策略可零样本迁移至不同规模的求解器。
AI 推荐理由
论文核心解决长上下文噪声中证据缺失导致的推理失败问题,通过高亮机制直接提升推理效果。
研究机构
Stony Brook University
Meta AI
论文信息