摘要
科学图表多项选择题回答要求模型基于多样化的视觉证据进行推理。然而,该场景存在一种独特偏差:答案选项本身可作为先验,诱导多模态模型偏向科学上合理但非图像支持的选项。为此,本文提出 SCICON,一种无需训练的解码方法,通过从图像条件得分中减去纯文本选项得分来评估候选项。该方法直接针对候选文本中编码的选择诱导先验。在三个基准和三种模型骨干上的实验表明,SCICON 显著优于标准解码基线,有效提升了基于图像的推理能力。
AI 推荐理由
论文提出对比解码方法,旨在消除选项偏见,提升多模态模型基于图像证据的科学推理能力。
研究机构
韩国大学
AIGEN Sciences
论文信息