摘要
扩散大语言模型(dLLMs)作为自回归模型的替代方案,正扩展至多模态任务。然而,结合思维链推理时,dMLLMs 存在两大缺陷:过早生成最终答案导致推理不充分,以及初始阶段对视觉提示依赖不足。为此,本文提出位置与步长惩罚(PSP)以延迟答案生成,鼓励渐进式推理;并提出视觉推理引导(VRG)以增强视觉证据的对齐。实验表明,该方法在多个 dMLLMs 上准确率提升高达 7.5%,且相比增加扩散步数的基线方法速度提升超过 3 倍。
AI 推荐理由
论文核心解决扩散多模态模型中的推理过早收敛与视觉 grounding 不足问题,提出新机制提升推理能力。
研究机构
汉阳大学计算机科学系
汉阳大学人工智能系
论文信息