摘要
本文构建了包含 40 个实证政策评估案例的基准,按直觉性分类,评估四种前沿大语言模型在不同提示策略下的表现。研究发现:思维链提示虽显著提升直观案例性能,但在反直觉案例中优势几乎消失;直觉性是主导因素,解释方差超过模型选择;存在知识与推理分离现象,即模型具备相关知识却无法在违背直觉时正确推理。研究基于双过程理论,指出当前大模型的“慢思考”可能仅是形式上的深思熟虑。
AI 推荐理由
核心研究 LLM 反事实推理能力,深入分析思维链在直觉冲突场景下的失效机制。
研究机构
Independent Researcher
论文信息