摘要
视觉语言模型在单图理解上进展显著,但多图推理仍具挑战。现有方法多依赖预设索引进行局部推理,缺乏全局视觉搜索与自主跨图比较能力。为此,本文提出“由简至难”(S2H)学习框架,构建涵盖单图局部推理、多图局部比较及全局视觉搜索三个层级的偏好数据。该方法利用提示驱动的复杂性生成通用偏好对,而非依赖特定模型属性。实验表明,该框架在提升多图推理性能的同时,保持了强大的单图推理能力,推动了整体视觉偏好对齐技术的发展。
AI 推荐理由
论文核心解决多图像推理能力缺口,提出分层推理框架显著提升全局搜索与跨图比较性能。
研究机构
Michigan State University
Carnegie Mellon University
论文信息