摘要
针对现有心理理论(ToM)评估多基于文本而忽视纯视觉场景的问题,本文提出 VisionToM 框架。该方法通过计算干预向量,将视觉表征与正确语义目标对齐,引导模型在不同视觉特征层间的注意力,从而减少对虚假语言先验的依赖。在 EgoToM 基准上的实验表明,该方法显著提升了多模态大语言模型的 ToM 推理能力及开放域解释生成的准确性,推动了人机协作的对齐。
AI 推荐理由
论文核心在于通过干预机制增强多模态模型的心理理论推理能力,解决幻觉与注意力偏差问题。
研究机构
北京科技大学
论文信息