Vision-Language Models Process Reward Models Reasoning Verification Multimodal Reasoning
摘要

视觉语言过程奖励模型(VL-PRMs)常用于评估推理中间步骤,但常因感知误差导致评分失真。本文提出显式视觉前提验证(EVPV)方法,通过生成视觉检查清单并提取结构化约束,显式验证步骤依赖的视觉事实。该方法利用可靠性门控机制校准奖励,有效解耦感知不确定性与逻辑评估。实验表明,EVPV 在多个基准上显著提升了步骤级验证能力及重排序准确率,且性能增益源于约束保真度而非提示效应。

AI 推荐理由

论文核心解决多模态推理中感知与逻辑纠缠问题,通过显式前提验证提升推理步骤评分可靠性。

研究机构
阿里云大模型应用团队,阿里巴巴 中国科学院自动化研究所
论文信息
作者 Junxin Wang, Dai Guan, Weijie Qiu, Zhihang Li, Yongbo Gai et al.
发布日期 2026-03-17
arXiv ID 2603.16253
相关性评分 9/10 (高度相关)