摘要
本文探讨大语言模型是否具备真正的心智理论能力,通过扰动错误信念任务测试其鲁棒性,并考察思维链提示的作用。研究构建了包含经典及扰动任务的高质量数据集,提出评估推理链正确性及答案忠实度的指标。结果显示,任务扰动导致模型性能显著下降,质疑了其稳健心智理论的存在;虽思维链整体提升了表现,但在部分扰动类别中反而降低准确率,表明需选择性应用。
AI 推荐理由
论文核心研究 LLM 在心智理论任务中的推理鲁棒性及思维链对推理的影响。
研究机构
波恩-阿亨国际信息科技中心
波恩大学信息学院
论文信息