摘要
大型视觉语言模型(LVLM)正迈向真正的多模态推理,其中视觉搜索是“图像思维”范式的具体体现。然而,LVLM 在视觉搜索中面临后训练内在能力不兼容及长程多步推理上下文干扰两大挑战。为此,本文提出两项新见解:首先,利用预训练模型的单步内在能力进行自我调节,以缓解能力退化;其次,提出基于概率的预言采样机制,替代朴素提示,使预训练模型充当“预言者”,后训练模型选择性接受预言 token,从而保持多步推理的连贯性。基于此,我们推出了 SeProD 框架,无需训练即可提升多模型在视觉搜索及通用 VQA 任务上的表现。
AI 推荐理由
论文核心解决 LVLM 多步视觉搜索中的推理干扰问题,提出自预言解码框架以增强连贯推理能力。
研究机构
Equal contribution
School of Computer Science and Engineering, Sun Yat-sen University, Shanghai Tech University
论文信息