long-context multi-hop reasoning LLM evaluation retrieval
摘要

本文评估了五款宣称具备 1M 令牌上下文窗口的尖端大语言模型在中文古籍语料上的长上下文检索与推理能力。研究包含两项实验:测试一测量 1M 输入下的单针检索,区分真实上下文检索与训练记忆依赖;测试二探测需中间推理的多跳能力,测量跨越三个上下文层级(256K、512K、1M)的三跳链遍历。研究发现,最强模型虽能解决单针检索,但在多跳任务中表现出三种不同的性能衰减特征,表明标称上下文长度并非可用多跳能力的良好代理,512K 至 1M 的过渡区是关键判别点。

AI 推荐理由

论文核心评估长上下文下的多跳推理能力,深入分析推理性能随长度变化的衰减模式。

研究机构
香港大学人文学院
论文信息
作者 Eric H. C. Chow
发布日期 2026-05-04
arXiv ID 2605.02173
相关性评分 9/10 (高度相关)