概率推理 基准测试 思维链 令牌偏差
摘要

本文通过受控基准研究调查大语言模型的离散概率推理能力。构建了标准习题与反直觉习题两组数据集以触发启发式推理,并评估了八种最先进模型在有无思维链提示下的表现。结果显示,模型在标准问题上平均准确率达 0.96,但在反直觉问题上仅为 0.59。研究进一步提供了令牌偏差的经验证据:当规范表述被伪装变体替代时,性能下降超 20%;嵌入误导性建议可使性能降低高达 34%,且无一模型能幸免。结论表明,尽管在高级数学问题上表现成功,当前大语言模型尚非真正的概率推理者。

AI 推荐理由

论文核心评估 LLM 的概率推理能力,通过基准测试分析思维链效果及启发式偏差。

研究机构
Università degli Studi di Firenze
论文信息
作者 Luca Avena, Gianmarco Bet, Bernardo Busoni
发布日期 2026-06-05
arXiv ID 2606.07515
相关性评分 9/10 (高度相关)