counterfactual reasoning chain-of-thought dual-process theory policy evaluation
摘要

本文构建了包含 40 个实证政策评估案例的基准,按直觉性分类,评估四种前沿大语言模型在不同提示策略下的表现。研究发现:思维链提示虽显著提升直观案例性能,但在反直觉案例中优势几乎消失;直觉性是主导因素,解释方差超过模型选择;存在知识与推理分离现象,即模型具备相关知识却无法在违背直觉时正确推理。研究基于双过程理论,指出当前大模型的“慢思考”可能仅是形式上的深思熟虑。

AI 推荐理由

核心研究 LLM 反事实推理能力,深入分析思维链在直觉冲突场景下的失效机制。

研究机构
Independent Researcher
论文信息
作者 Yanjie He
发布日期 2026-04-12
arXiv ID 2604.10511
相关性评分 9/10 (高度相关)