Theory of Mind Chain-of-Thought Robustness False Belief Tasks
摘要

本文探讨大语言模型是否具备真正的心智理论能力,通过扰动错误信念任务测试其鲁棒性,并考察思维链提示的作用。研究构建了包含经典及扰动任务的高质量数据集,提出评估推理链正确性及答案忠实度的指标。结果显示,任务扰动导致模型性能显著下降,质疑了其稳健心智理论的存在;虽思维链整体提升了表现,但在部分扰动类别中反而降低准确率,表明需选择性应用。

AI 推荐理由

论文核心研究 LLM 在心智理论任务中的推理鲁棒性及思维链对推理的影响。

研究机构
波恩-阿亨国际信息科技中心 波恩大学信息学院
论文信息
作者 Christian Nickel, Laura Schrewe, Florian Mai, Lucie Flek
发布日期 2026-02-25
arXiv ID 2602.22072
相关性评分 9/10 (高度相关)