Visual Reasoning Latent Space Multimodal Learning Semantic Alignment
摘要

多模态潜在空间推理旨在通过在紧凑潜在空间中直接执行视觉推理来替代显式思维。然而,现有方法主要依赖视觉监督,生成的潜在表示缺乏足够的语义丰富性,限制了其在多样化区域级推理任务中的能力。本文提出语义增强潜在视觉推理(SLVR)两阶段学习框架,利用属性级视觉语义丰富潜在表示,并将其与多样化推理目标对齐。第一阶段在细粒度属性监督下学习以区域为中心的语义增强潜在量;第二阶段设计多查询组相对策略优化(M-GRPO),对齐基于同一区域的多个查询的潜在表示。实验表明,SLVR 显著提升了潜在视觉推理的鲁棒性与语义一致性。

AI 推荐理由

论文核心提出潜在空间视觉推理框架,直接针对推理能力的语义丰富性与一致性进行优化。

研究机构
中国科学院自动化研究所 北京科技大学 清华大学 阿里巴巴集团
论文信息
作者 Tianrun Xu, Yue Sun, Qixun Wang, Jingyi Lu, Yuan Wang et al.
发布日期 2026-05-19
arXiv ID 2605.19342
相关性评分 9/10 (高度相关)