多模态推理 潜在空间表示 视觉思维链
摘要

尽管语言推理模型表现优异,但当前大型多模态模型(LMM)在视觉推理方面仍面临挑战,常局限于将感知内容转化为文本。本文提出 LanteRn 框架,使 LMM 能够在推理过程中交错使用语言与紧凑的潜在视觉表示,直接在潜在空间进行视觉推理。该方法通过两阶段训练:首先监督微调以将视觉特征锚定于潜在状态,随后利用强化学习对齐潜在推理与任务效用。实验表明,该内部潜在表示显著提升了视觉定位与细粒度推理能力,为高效多模态推理提供了新方向。

AI 推荐理由

论文提出在潜在空间进行视觉推理的新框架,核心解决多模态模型的细粒度推理难题。

研究机构
Instituto de Telecomunicações Instituto Superior Técnico, Universidade de Lisboa Carnegie Mellon University
论文信息
作者 André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins
发布日期 2026-03-26
arXiv ID 2603.25629
相关性评分 9/10 (高度相关)