Multimodal LLM Visual Reasoning Feature Alignment Latent Modeling
摘要

视觉潜在推理允许多模态大语言模型生成连续令牌作为中间视觉证据,无需外部工具。然而,现有方法因特征空间不匹配导致增益不稳定。本文提出 GAP(细粒度对齐范式),通过三个层面解决该问题:特征级对齐将解码器输出映射为输入兼容的潜在向量;上下文级对齐利用辅助视觉监督锚定目标;容量引导对齐选择性分配监督。实验表明,该方法在 Qwen2.5-VL 7B 上显著提升了感知与推理性能,生成的潜在向量提供了超越单纯增加令牌的任务相关视觉信号。

AI 推荐理由

论文核心解决多模态大模型的视觉潜在推理问题,提出新范式以提升推理稳定性与性能。

研究机构
University of Waterloo Zhejiang University
论文信息
作者 Yanting Miao, Yutao Sun, Dexin Wang, Mengyu Zhou, Pascal Poupart et al.
发布日期 2026-05-12
arXiv ID 2605.12374
相关性评分 9/10 (高度相关)