摘要
尽管语言推理模型表现优异,但当前大型多模态模型(LMM)在视觉推理方面仍面临挑战,常局限于将感知内容转化为文本。本文提出 LanteRn 框架,使 LMM 能够在推理过程中交错使用语言与紧凑的潜在视觉表示,直接在潜在空间进行视觉推理。该方法通过两阶段训练:首先监督微调以将视觉特征锚定于潜在状态,随后利用强化学习对齐潜在推理与任务效用。实验表明,该内部潜在表示显著提升了视觉定位与细粒度推理能力,为高效多模态推理提供了新方向。
AI 推荐理由
论文提出在潜在空间进行视觉推理的新框架,核心解决多模态模型的细粒度推理难题。
研究机构
Instituto de Telecomunicações
Instituto Superior Técnico, Universidade de Lisboa
Carnegie Mellon University
论文信息