摘要
视觉 - 语言模型(VLM)功能强大但缺乏透明度。本文提出了首个 VLM 透明电路追踪框架,以系统分析多模态推理。利用转码器、归因图和注意力机制,我们揭示了 VLM 如何分层整合视觉与语义概念。研究发现,特定的视觉特征电路可处理数学推理并支持跨模态关联。经特征引导和电路修补验证,该框架证明了这些电路的因果性与可控性,为构建更可解释、可靠的 VLM 奠定了基础。
AI 推荐理由
论文核心在于通过电路追踪解析 VLM 的多模态推理机制,直接揭示数学推理等内部过程。
研究机构
伊利诺伊大学厄巴纳-香槟分校
独立研究员
论文信息