摘要
视觉语言过程奖励模型(VL-PRMs)常用于评估推理中间步骤,但常因感知误差导致评分失真。本文提出显式视觉前提验证(EVPV)方法,通过生成视觉检查清单并提取结构化约束,显式验证步骤依赖的视觉事实。该方法利用可靠性门控机制校准奖励,有效解耦感知不确定性与逻辑评估。实验表明,EVPV 在多个基准上显著提升了步骤级验证能力及重排序准确率,且性能增益源于约束保真度而非提示效应。
AI 推荐理由
论文核心解决多模态推理中感知与逻辑纠缠问题,通过显式前提验证提升推理步骤评分可靠性。
研究机构
阿里云大模型应用团队,阿里巴巴
中国科学院自动化研究所
论文信息