In-Context Learning Rule Inference Mechanistic Interpretability Attention Analysis
摘要

上下文学习使大模型能通过少样本演示执行新任务,但演示中的噪声与冲突会削弱该能力。本文研究需推断潜在模式的规则推理任务,发现单个错误演示即导致性能显著下降。通过线性探测与 Logit Lens 分析,揭示模型在中间层同时编码正确与错误规则,仅在晚期形成预测置信度的两阶段计算结构。研究进一步定位了导致推理失败的关键注意力头:早中期层的“脆弱头”对污染高度敏感,晚期层的“易感头”则大幅降低对正确预测的支持。针对性消融实验表明,屏蔽少量关键头可提升性能超 10%。

AI 推荐理由

论文深入探究上下文学习中冲突样本对规则推理的影响及内部机制,属推理核心研究。

研究机构
中国机构未明确标注
论文信息
作者 Difan Jiao, Di Wang, Lijie Hu
发布日期 2026-03-03
arXiv ID 2603.04464
相关性评分 9/10 (高度相关)