摘要
大型语言模型在多步推理中常产生幻觉,现有检测器多在轨迹层面操作,无法定位首个错误。本文提出将幻觉视为单次前向传播中隐藏状态轨迹的属性:正确推理沿稳定流形进行,而首个错误表现为传输成本的局部偏离。作者构建了基于标签的教师模型,利用对比 PCA 提取几何特征评分每一步,并蒸馏出无需推理时标签的学生模型。理论证明了对比 PCA 的最优性及单步定位条件。实验表明,该方法在多个基准上优于熵基和注意力基线,但学生模型在分布偏移下表现下降,揭示了部署的主要障碍。
AI 推荐理由
论文核心研究多步推理中的幻觉检测,通过隐藏状态轨迹几何分析定位推理错误步骤。
研究机构
罗切斯特理工学院, 美国
论文信息