摘要
尽管视觉语言模型(VLM)在多模态推理任务上表现优异,但在真实场景中读取模拟时钟仍面临巨大挑战。现有数据集多为合成或平面图像,缺乏多样性,导致模型时空推理能力薄弱,常混淆时针分针且难以应对遮挡等干扰。为此,本文提出了包含多样真实场景的人工标注数据集 TickTockVQA,并提供精确的时分标注及上下文推断的 AM/PM 标签。此外,作者提出基于直接偏好优化的 Swap-DPO 微调框架,以对齐模型的准确时间解读推理。实验表明,该方法显著提升了模型在真实条件下的读数准确率与鲁棒性。
AI 推荐理由
论文核心解决 VLM 在模拟时钟读取中的时空推理缺陷,提出新数据集与优化框架以提升推理准确性。
研究机构
仁川国立大学
麦吉尔大学
论文信息