摘要
大型视觉语言模型在显式视觉识别方面表现卓越,但在处理视觉输入仅作为线索而非直接答案的任务时存在显著认知差距。本文指出,当前模型难以解决需要复杂多步推理的问题,即信息未明确描绘的场景。解决画谜(Rebus)需要独特的认知工作流:提取视听属性、检索语言先验知识(如成语),并执行抽象映射以合成像素空间之外的含义。为此,我们引入了包含 1164 个谜题的基准测试 RebusBench。评估显示,最先进模型的性能严重不足,精确匹配率低于 10%,表明模型缺乏连接视觉与语言组件的认知推理纽带。
AI 推荐理由
论文核心评估多模态模型的抽象映射与多步认知推理能力,直接针对推理短板。
研究机构
Sharif University of Technology
论文信息