摘要
针对主导的准确率评估可能奖励无依据猜测且不适用于无真值标注新任务的问题,本文基于基本逻辑原则,提出了一种评估多模态大模型(MLLMs)在充分及必要因果关系上视觉 - 语言逻辑一致性的新框架。定义了无需真值标注的视觉 - 语言逻辑一致性指标(VL-LCM),并在 MMMU 和 NaturalBench 等基准上评估了 11 个开源模型。研究发现,尽管近期 MLLMs 准确率显著提升,但其逻辑一致性仍严重滞后。实验证实了 VL-LCM 的有效性与适用性,表明该指标可用于模型选择、验证及无标注场景下的可靠答案论证。
AI 推荐理由
论文核心提出基于逻辑一致性的评估框架,直接针对多模态模型的逻辑推理能力进行度量与验证。
研究机构
新加坡资讯通信研究院(Infocomm Research, ITR)
新加坡科技研究局(A*STAR)
论文信息