摘要
尽管多模态大语言模型(MLLMs)表现优异,但预测图像的说服力及其原因仍具挑战。研究发现,直接提示模型先推理再预测不仅无效,甚至可能降低性能,表明 naive 生成的理由不可靠。为此,本文提出利用多样化的教师生成理由进行监督微调,显著提升预测效果。此外,引入涵盖一致性、 groundedness 和敏感性的三维忠实度评估框架,揭示仅凭预测性能无法保证推理忠实度,其中敏感性最符合人类偏好。研究推动了面向忠实度的训练目标及可扩展的理由监督方法。
AI 推荐理由
论文核心研究多模态大模型的视觉推理能力、思维链生成及推理忠实度评估。
研究机构
Seoul National University
论文信息