Diffusion LLM Visual Reasoning Chain-of-Thought Multimodal Learning
摘要

扩散大语言模型(dLLMs)作为自回归模型的替代方案,正扩展至多模态任务。然而,结合思维链推理时,dMLLMs 存在两大缺陷:过早生成最终答案导致推理不充分,以及初始阶段对视觉提示依赖不足。为此,本文提出位置与步长惩罚(PSP)以延迟答案生成,鼓励渐进式推理;并提出视觉推理引导(VRG)以增强视觉证据的对齐。实验表明,该方法在多个 dMLLMs 上准确率提升高达 7.5%,且相比增加扩散步数的基线方法速度提升超过 3 倍。

AI 推荐理由

论文核心解决扩散多模态模型中的推理过早收敛与视觉 grounding 不足问题,提出新机制提升推理能力。

研究机构
汉阳大学计算机科学系 汉阳大学人工智能系
论文信息
作者 Keuntae Kim, Mingyu Kang, Yong Suk Choi
发布日期 2026-04-07
arXiv ID 2604.05497
相关性评分 9/10 (高度相关)