VLM Engineering Reasoning Benchmark Process-oriented Evaluation
摘要

视觉语言模型(VLM)在通用多模态推理基准上表现优异,但其工程推理能力尚未经过充分探索。工程问题解决需解读技术图表、选择物理原理并保持多步推理的物理一致性。现有基准主要评估最终答案,缺乏对中间推理过程的细粒度分析。本文提出 EngVQA 基准,涵盖五个工程学科共 696 个问题,并引入八阶段自动评估框架,独立评估解题各阶段以精准定位推理缺陷。实验表明当前 VLM 在工程推理方面存在显著局限,且自动评估结果与人工评分高度一致。

AI 推荐理由

论文核心评估 VLM 在工程领域的多步推理能力,提出分阶段评估框架分析推理失败。

研究机构
Indian Institute of Technology Kharagpur
论文信息
作者 Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde, Debaditya Roy
发布日期 2026-06-09
arXiv ID 2606.10833
相关性评分 9/10 (高度相关)