Theory of Mind Multimodal LLM Intervention Visual Reasoning
摘要

针对现有心理理论(ToM)评估多基于文本而忽视纯视觉场景的问题,本文提出 VisionToM 框架。该方法通过计算干预向量,将视觉表征与正确语义目标对齐,引导模型在不同视觉特征层间的注意力,从而减少对虚假语言先验的依赖。在 EgoToM 基准上的实验表明,该方法显著提升了多模态大语言模型的 ToM 推理能力及开放域解释生成的准确性,推动了人机协作的对齐。

AI 推荐理由

论文核心在于通过干预机制增强多模态模型的心理理论推理能力,解决幻觉与注意力偏差问题。

研究机构
北京科技大学
论文信息
作者 Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma et al.
发布日期 2026-03-25
arXiv ID 2603.24484
相关性评分 9/10 (高度相关)