MLLM Social Cognition Reasoning Bias Evaluation
摘要

针对多模态大语言模型(MLLMs)在人格感知中可能存在的表面模式匹配问题,本文提出了“基于证据的人格推理”(GPR)新任务,要求模型将评分锚定于可观察的行为证据。作者发布了包含视频和多项选择题的 MM-OCEAN 数据集,并设计了涵盖评分、推理及证据锚定的三层评估体系。实验揭示了显著的“偏见差距”,表明多数正确评分缺乏合理的证据支撑,指出了当前模型在社会认知推理上的不足。

AI 推荐理由

论文提出基于证据的推理任务,核心评估模型是否具备真正的逻辑推理而非表面匹配。

研究机构
The University of Tokyo Shanda AI Research Tokyo Dalian University of Technology
论文信息
作者 Caixin Kang, Tianyu Yan, Sitong Gong, Mingfang Zhang, Liangyang Ouyang et al.
发布日期 2026-05-21
arXiv ID 2605.22109
相关性评分 9/10 (高度相关)