Multimodal Reasoning Latent Representation Depth Scaling Visual-Language Models
摘要

多模态隐式推理通过隐式特征传播替代显式思维链解码,提升了表示信息量并降低了推理延迟。本文分析发现:视觉 token 因语言偏差导致梯度范数更高且波动大,造成系统性欠优化;复杂 token 受固定架构深度限制而梯度不稳定。为此,提出视觉回放模块与路由深度缩放机制。前者利用因果自注意力估计显著性以增强细粒度定位;后者自适应分配额外推理步骤给复杂 token。在课程学习策略指导下,该框架在多个基准测试中取得最先进性能,并显著加速推理。

AI 推荐理由

论文核心研究多模态隐式推理机制,通过深度缩放优化复杂 token 的上下文推理能力。

研究机构
北京工业大学 阿里巴巴集团 香港城市大学
论文信息
作者 Yudong Han, Yong Wang, Zaiquan Yang, Zhen Qu, Liyuan Pan et al.
发布日期 2026-04-12
arXiv ID 2604.10500
相关性评分 9/10 (高度相关)