摘要
多模态大语言模型生成的推理链常含细微错误。现有验证方法存在局限:学习型评论家需大量数据且表现不稳定;免训练方法仅简单平均分数,忽视了分歧本身蕴含的有效性信息。本文提出一种免训练验证方法,将逐步验证视为专用评判器间的协调问题,形式化为纳什均衡博弈:一致表示有效,分歧揭示不稳定。该方法通过闭式解计算均衡分数,实现感知分歧的过滤与关注稳定性的排序。在六个基准测试中,该方法较基线提升 2.4% 至 5.2%,性能媲美学习型评论家,证明跨模态一致性可提供鲁棒的验证信号。
AI 推荐理由
论文核心在于通过博弈论框架验证多模态推理链步骤,直接提升推理准确性。
研究机构
Microsoft Research India
Indian Institute of Technology Hyderabad
论文信息