cross-modal transfer neuron analysis inference mechanism parameter-efficient fine-tuning
摘要

大型视觉语言模型(LVLM)在多步推理任务上仍落后于纯文本大模型。本文发现,两者在多步推理中超过一半的高激活神经元是共享的,构成了模态不变的推理子空间。基于此,作者提出共享神经元低秩融合(SNRF)框架,通过将 LLM 成熟的推理电路高效迁移至 LVLM,显著提升了其在数学和感知基准上的推理性能,同时保留了感知能力且无需大规模微调。

AI 推荐理由

论文核心研究多步推理的神经机制及通过神经元共享提升 LVLM 推理能力。

研究机构
National University of Singapore, Singapore University of Science and Technology of China, Hefei, China
论文信息
作者 Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng et al.
发布日期 2026-02-22
arXiv ID 2602.19058
相关性评分 9/10 (高度相关)