摘要
大语言模型(LLM)虽具备广博知识,但其对计算过程的推理能力尚不明确。本文以因果发现为测试平台,基于大规模算法执行的真值评估了八种前沿 LLM,发现其存在系统性且近乎完全的失败。模型生成的置信区间过宽且大多未包含真实均值,表现甚至劣于随机猜测。最佳模型的微弱优势更倾向于基准记忆而非原则性推理。这种“算法盲目性”反映了关于算法的陈述性知识与校准后的程序性预测之间的根本差距。
AI 推荐理由
论文核心评估 LLM 对计算过程的推理能力,揭示其在算法预测上的系统性失败。
研究机构
Manipal Institute of Technology, Bengaluru, India
论文信息