Multimodal Reasoning Vision-Language Models Trustworthiness Evaluation Metrics
摘要

本文指出当前视觉 - 语言模型(VLM)存在严重的可信度危机,常利用语言先验绕过视觉表征瓶颈而非真正理解图像。作者挑战传统评估方法,提出“模态翻译协议”及三项新指标(看见的过路费、诅咒与谬误),最终形成语义充分性准则。文章进一步提出多模态缩放发散定律,认为随着语言引擎推理能力增强,视觉瓶颈的数学惩罚反而增加,旨在为构建真正具备多模态推理能力的下一代 AI 系统奠定严谨基础。

AI 推荐理由

论文核心探讨多模态推理的可信度危机,提出评估视觉知识瓶颈的新指标与理论。

研究机构
IIT Delhi, India
论文信息
作者 Karan Goyal, Dikshant Kukreja
发布日期 2026-04-22
arXiv ID 2604.20665
相关性评分 9/10 (高度相关)