Theory of Mind Benchmark Social Reasoning Dialogue Analysis
摘要

大型语言模型(LLM)虽展现出心智理论(ToM)能力,但其源于稳健推理还是虚假关联尚不明确。本文提出 DialToM,一个基于自然人类对话并经人工验证的多选题基准。该基准不仅评估心理状态预测(字面 ToM),还通过前瞻性诊断预测评估其功能效用(功能 ToM),即探究模型能否仅凭心理状态画像识别符合状态的对话轨迹。结果显示显著的推理不对称性:除 Gemini 3 Pro 外,大多数模型虽擅长识别心理状态,却无法利用此理解预测社交轨迹。此外,人类与 LLM 生成的推论间语义相似性较弱。数据集与代码已公开以促进复现。

AI 推荐理由

论文核心评估 LLM 的心智理论推理能力,重点分析状态预测与轨迹推断中的推理不对称性。

研究机构
新加坡管理大学 澳大利亚国立大学
论文信息
作者 Neemesh Yadav, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim
发布日期 2026-04-22
arXiv ID 2604.20443
相关性评分 9/10 (高度相关)