Nash Equilibrium Step Verification Multimodal Reasoning Training-Free
摘要

多模态大语言模型生成的推理链常含细微错误。现有验证方法存在局限:学习型评论家需大量数据且表现不稳定;免训练方法仅简单平均分数,忽视了分歧本身蕴含的有效性信息。本文提出一种免训练验证方法,将逐步验证视为专用评判器间的协调问题,形式化为纳什均衡博弈:一致表示有效,分歧揭示不稳定。该方法通过闭式解计算均衡分数,实现感知分歧的过滤与关注稳定性的排序。在六个基准测试中,该方法较基线提升 2.4% 至 5.2%,性能媲美学习型评论家,证明跨模态一致性可提供鲁棒的验证信号。

AI 推荐理由

论文核心在于通过博弈论框架验证多模态推理链步骤,直接提升推理准确性。

研究机构
Microsoft Research India Indian Institute of Technology Hyderabad
论文信息
作者 Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma et al.
发布日期 2026-05-19
arXiv ID 2605.20033
相关性评分 9/10 (高度相关)