multi-hop reasoning pretraining data compositionality LLM limitations
摘要

大型语言模型在隐式多跳推理中表现不佳:即使能单独正确回答组成问题的各个事实,也无法在单次前向传播中完成组合推理。本研究在受控自然语言环境下,严格区分预训练中接触过组合语境与未接触的个体,证实即便单跳准确率达 97%,组合失败依然存在,表明这是预训练缺陷而非知识缺失。实验测试了九种数据增强格式,发现组合预训练仅对已暴露个体有效,无法迁移至未见个体,证明预训练期间的组合语境暴露是隐式多跳推理的必要条件。

AI 推荐理由

论文核心研究隐式多跳推理失败原因,证实预训练暴露是必要条件。

研究机构
Inria, Paris, France Inria, Chile Dept. of Computer Science, Universidad de Chile
论文信息
作者 Yannis Karmim, Luis Marti, Djamé Seddah, Valentin Barrière
发布日期 2026-06-08
arXiv ID 2606.09338
相关性评分 9/10 (高度相关)