摘要
多模态大语言模型(MLLMs)通过整合强大语言骨干与大规模视觉编码器取得了显著性能。其中,潜在思维链(CoT)方法能在连续隐藏状态中实现隐式推理,促进视听无缝融合及加速推断。然而,现有潜在 CoT 中启发式预定义的监督信号在保留中间潜状态的关键视觉信息方面指导有限。为此,我们提出 CrystaL(结晶潜推理),这是一种单阶段框架,包含两条分别处理完整和损坏图像的路径。通过在两条路径间显式对齐注意力模式和预测分布,CrystaL 无需辅助标注或外部模块,即可将潜表示结晶为任务相关的视觉语义。在感知密集型基准上的大量实验表明,CrystaL 持续优于最先进基线,在细粒度视觉理解上取得显著提升,同时保持稳健的推理能力。
AI 推荐理由
论文提出 CrystaL 框架,通过显式对齐注意力模式优化潜在思维链(CoT),核心解决多模态推理中的视觉信息保留问题。
研究机构
中国科学院
论文信息