Spatial Reasoning Mechanistic Interpretability Multimodal LLM Lexical Bias DPO
摘要

多模态大语言模型(MLLMs)在空间选择题上表现不可靠,常归因于视觉信息关注不足。本文发现一种互补的失败模式:空间词汇偏差,即在选项中添加空间关系词会诱导模型选择该选项。研究通过九种开源模型验证了该现象的普遍性,并利用机制可解释性工具揭示故障主要源于语言侧而非视觉侧。基于此,作者提出仅针对 LLM 的轻量级 DPO 更新方法,显著提升了模型在多个数据集上的空间推理鲁棒性。

AI 推荐理由

论文核心研究多模态大模型的空间推理偏差机制,通过可解释性工具定位语言侧故障并提出修复方案。

研究机构
京都大学 香港理工大学 NIH LLMLC RIKEN AIP Case Western Reserve University 东京大学
论文信息
作者 Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang et al.
发布日期 2026-06-01
arXiv ID 2606.01914
相关性评分 9/10 (高度相关)