摘要
大型视觉语言模型(LVLM)在多步推理任务上仍落后于纯文本大模型。本文发现,两者在多步推理中超过一半的高激活神经元是共享的,构成了模态不变的推理子空间。基于此,作者提出共享神经元低秩融合(SNRF)框架,通过将 LLM 成熟的推理电路高效迁移至 LVLM,显著提升了其在数学和感知基准上的推理性能,同时保留了感知能力且无需大规模微调。
AI 推荐理由
论文核心研究多步推理的神经机制及通过神经元共享提升 LVLM 推理能力。
研究机构
National University of Singapore, Singapore
University of Science and Technology of China, Hefei, China
论文信息