Theory of Mind Multimodal Benchmark Social Reasoning LLM Evaluation
摘要

心智理论(ToM)即推演自身及他人心理状态的能力,是人类社会智能的基石。随着大语言模型(LLM)的普及,验证其社会推理能力至关重要。然而,现有基准多局限于文本输入且侧重信念任务。本文提出 CoMMET,一个受心智理论手册任务启发的多模态综合基准,涵盖更广泛的心理状态并引入多轮对话测试。这是首个在多轮对话场景中评估 ToM 的多模态数据集。通过对不同家族和规模模型的全面评估,本文分析了当前模型的优势与局限,为未来改进指明方向,深化了对现代 LLM 社会认知能力的理解。

AI 推荐理由

论文核心评估 LLM 的心智理论推理能力,构建多模态基准测试其社会认知推理水平。

研究机构
高性能计算研究所(IHPC),前沿人工智能研究中心(CFAR),科学、技术与研究局(A*STAR),新加坡 南洋理工大学,新加坡
论文信息
作者 Ruirui Chen, Weifeng Jiang, Chengwei Qin, Cheston Tan
发布日期 2026-03-12
arXiv ID 2603.11915
相关性评分 9/10 (高度相关)