类比推理 表征探测 叙事理解 LLM 评估
摘要

类比推理是叙事理解的核心认知能力。尽管大语言模型在表面与结构线索一致时表现良好,但在需要挖掘潜在信息的非显性类比中表现不佳,显示出抽象与泛化能力的局限。本文对比了模型被探测的内部表征与其通过提示检测叙事类比的性能,发现了一种不对称性:对于修辞类比,探测显著优于提示;而对于叙事类比,两者性能均较低且相近。这表明内部表征与提示行为之间的关系依赖于任务,并反映了提示机制在访问可用信息方面的局限性。

AI 推荐理由

论文核心研究 LLM 的类比推理能力,通过探测内部表征与提示性能的差异揭示推理局限。

研究机构
Cambridge University Northeastern University Athenahealth Johns Hopkins University
论文信息
作者 Hope McGovern, Caroline Craig, Thomas Lippincott, Hale Sirin
发布日期 2026-04-04
arXiv ID 2604.03877
相关性评分 9/10 (高度相关)