摘要
本文针对视觉 - 语言模型(VLM)在时间顺序推理方面的不足,提出了专用基准测试。通过构建三个涵盖长历史跨度物体、多样化事件类型及跨模态新闻文本的数据集,深入评估模型对图像内及图像间时间信息的感知与推理逻辑。实验发现,尽管 VLM 展现出一定潜力,但常依赖灰度或色彩等表面线索而非真实时间特征进行判断,存在严重的“错误捷径”现象。该研究为诊断模型局限及开发更稳健的多模态推理模型提供了重要工具。
AI 推荐理由
论文核心聚焦于评估 VLM 的时间顺序推理能力及捷径偏差,属于推理能力研究。
研究机构
Graduate Student Member, IEEE
Member, IEEE
论文信息