摘要
本文提出 KnotBench 基准,旨在评估视觉语言模型(VLM)在图解结推理方面的能力。该基准包含近 86 万张图像,涵盖 14 项任务,涉及等价性判断、移动预测及跨模态 grounding 等。实验显示,即便启用思维链模式,当前主流模型在将图表转换为符号序列及模拟拓扑变换方面表现不佳,多数任务得分接近随机基线。研究表明,现有 VLM 虽能感知图像特征,但缺乏对特征进行逻辑操作和模拟演变的深层推理机制。
AI 推荐理由
论文核心评估 VLM 在复杂拓扑结构上的逻辑推理与状态模拟能力,属于推理基准研究。
研究机构
Department of Psychology, New York University
Department of Computer Science, University of Southern California
论文信息