Visual-Language Models Procedural Reasoning Chain-of-Thought Multimodal Benchmark
摘要

尽管视觉语言模型在标准任务中表现优异,但其在视觉程序问答(VP-QA)领域的潜力尚未被充分挖掘。针对用户基于中间状态图像查询下一步动作的挑战,本文提出了 ProcedureVQA 基准,并指出当前模型存在跨模态检索不足及粒度不对齐两大局限。为此,我们设计了“过程链”(CoP)分层推理框架,通过视觉线索检索指令、语义分解细化步骤,最终生成下一步动作。实验表明,该方法在六个模型上均显著优于基线,绝对提升高达 13%。

AI 推荐理由

提出分层推理框架 CoP,核心解决视觉程序问答中的多步逻辑推理与语义分解问题。

研究机构
澳门大学电子工程与计算机科学学院 澳门大学认知与脑科学中心
论文信息
作者 Guanhua Chen, Yutong Yao, Shenghe Sun, Ci-Jun Gao, Shudong Liu et al.
发布日期 2026-05-14
arXiv ID 2605.14928
相关性评分 9/10 (高度相关)