hallucination mechanistic interpretability structured knowledge reasoning failure
摘要

在许多推理任务中,大语言模型依赖图或表等结构化外部知识,这些知识通常被线性化为序列令牌表示。然而,即使知识充足,模型仍会产生幻觉。本文研究发现,幻觉源于系统性内部动态而非随机噪声:注意力机制过度集中于捷径式结构线索,前馈层未能有效锚定外部知识导致回退至参数记忆。结果表明,语义锚定失败与幻觉高度相关,且该机制在多跳图和表格场景中具有泛化性,可用于有效检测幻觉。

AI 推荐理由

论文深入分析 LLM 在结构化知识推理中的幻觉机制,核心聚焦推理过程。

研究机构
University of Illinois Urbana-Champaign
论文信息
作者 Shanghao Li, Jinda Han, Yibo Wang, Yuanjie Zhu, Zihe Song et al.
发布日期 2026-05-25
arXiv ID 2605.26362
相关性评分 9/10 (高度相关)