摘要
视觉语言模型(VLM)在通用多模态推理基准上表现优异,但其工程推理能力尚未经过充分探索。工程问题解决需解读技术图表、选择物理原理并保持多步推理的物理一致性。现有基准主要评估最终答案,缺乏对中间推理过程的细粒度分析。本文提出 EngVQA 基准,涵盖五个工程学科共 696 个问题,并引入八阶段自动评估框架,独立评估解题各阶段以精准定位推理缺陷。实验表明当前 VLM 在工程推理方面存在显著局限,且自动评估结果与人工评分高度一致。
AI 推荐理由
论文核心评估 VLM 在工程领域的多步推理能力,提出分阶段评估框架分析推理失败。
研究机构
Indian Institute of Technology Kharagpur
论文信息