Multimodal ICL Inductive-Deductive Reasoning Vision-Language Models Chain-of-Thought
摘要

针对视觉语言模型在上下文学习中存在的归纳差距及视觉冗余、注意力偏差问题,本文提出一种基于归纳 - 演绎原理的重构框架。该框架包含基于相似度的视觉令牌压缩模块、动态注意力重平衡机制,以及显式引导模型分析示例、推导通用规则并应用的思维链范式。此外,结合监督微调与强化学习的辅助流程进一步增强了引用的忠实性与噪声过滤能力。在八个基准测试上的评估表明,该方法显著优于标准基线,证明了赋予模型真正归纳能力的潜力。

AI 推荐理由

论文核心提出归纳 - 演绎推理框架,通过思维链显式引导模型推导规则,显著提升多模态推理能力。

研究机构
Tencent QQ Fudan University Cornell University
论文信息
作者 Haoyu Wang, Haonan Wang, Yuyan Chen, Jun Chen, Gang Liu et al.
发布日期 2026-05-04
arXiv ID 2605.02378
相关性评分 9/10 (高度相关)