摘要
针对多模态大语言模型(MLLMs)在人格感知中可能存在的表面模式匹配问题,本文提出了“基于证据的人格推理”(GPR)新任务,要求模型将评分锚定于可观察的行为证据。作者发布了包含视频和多项选择题的 MM-OCEAN 数据集,并设计了涵盖评分、推理及证据锚定的三层评估体系。实验揭示了显著的“偏见差距”,表明多数正确评分缺乏合理的证据支撑,指出了当前模型在社会认知推理上的不足。
AI 推荐理由
论文提出基于证据的推理任务,核心评估模型是否具备真正的逻辑推理而非表面匹配。
研究机构
The University of Tokyo
Shanda AI Research Tokyo
Dalian University of Technology
论文信息