Visual Reasoning Mental Imagery Chain of Thought Multimodal LLM
摘要

本文发现大型多模态模型在解决空间谜题时会形成心理意象。通过微调 Qwen3.5 视觉语言模型处理十二种视觉推理任务,研究表明模型动作后的激活编码了有意义的中间状态视觉信息,暗示隐式视觉世界模型的生成。基于此,作者提出两种利用该心理意象的方法:将每步少量视觉令牌整合至思维链中,使平均求解率从 83% 提升至 89%,显著增强了拼图与三维旋转等重推理任务的性能。

AI 推荐理由

论文核心研究多模态模型在空间谜题中的视觉推理机制及思维链增强。

研究机构
Apple
论文信息
作者 Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun
发布日期 2026-05-10
arXiv ID 2605.09693
相关性评分 9/10 (高度相关)