摘要
受人类在噪声环境中自底向上识别关键线索并关联上下文的启发,本文提出 DeepScan,一种无需训练的框架,旨在提升大型视觉语言模型(LVLM)的视觉落地推理能力。该框架结合分层扫描、重聚焦和证据增强推理:分层扫描通过多尺度证据提取缓解干扰;重聚焦协同 LVLM 与视觉专家优化证据视图;证据增强推理利用混合证据记忆聚合多粒度视图以生成准确且可解释的答案。实验表明,DeepScan 显著提升了多种视觉任务的表现,尤其在细粒度理解上效果突出,且适用于不同架构与规模的模型。
AI 推荐理由
论文核心提出视觉落地推理框架,通过分层扫描与证据增强机制显著提升 LVLM 的推理能力。
研究机构
中国科学院大学
东北师范大学
四川大学
上海人工智能实验室
论文信息