摘要
现实世界的推理通常需要在多跳过程中结合文本上下文与视觉线索等跨模态信息。然而,现有大多模态基准未能有效捕捉此能力,其训练数据也缺乏强制性的互补多跳推理内容,导致视觉语言模型常产生幻觉且推理缺乏视觉依据。为此,本文提出 CRIT,一个基于图自动化流程生成的复杂跨模态推理任务数据集与基准。实验表明,即使最先进模型在此类任务上也表现挣扎,而在 CRIT 上训练的模型在跨模态多跳推理及标准基准测试中均取得显著提升。
AI 推荐理由
论文核心聚焦于跨模态多跳推理,提出新数据集与基准以增强该能力。
研究机构
Dept. of CSE, Korea University
Google DeepMind
论文信息