摘要
尽管近期大型多模态模型(LMMs)在视觉感知方面表现强劲,但在需要基于视觉证据进行多步推理的问题上仍不可靠。本文提出了 UnAC(理解、抽象与检查)方法,旨在增强 LMMs 处理复杂多模态任务的推理能力。该方法包含一种自适应视觉提示策略,使模型能聚焦于显著区域以捕捉细节;设计了图像抽象提示以有效提取关键信息;并引入渐进式自我检查机制,通过验证每个分解子问题及其答案来优化推理过程。在 MathVista、MM-Vet 和 MMMU 三个基准上的实验证明了其有效性。
AI 推荐理由
论文核心提出多步推理方法,通过抽象与逐步检查机制显著提升复杂多模态推理能力。
研究机构
Northeastern University
论文信息