Vision-Language Models Multi-image Reasoning Preference Optimization DPO
摘要

视觉语言模型在单图理解上进展显著,但多图推理仍具挑战。现有方法多依赖预设索引进行局部推理,缺乏全局视觉搜索与自主跨图比较能力。为此,本文提出“由简至难”(S2H)学习框架,构建涵盖单图局部推理、多图局部比较及全局视觉搜索三个层级的偏好数据。该方法利用提示驱动的复杂性生成通用偏好对,而非依赖特定模型属性。实验表明,该框架在提升多图推理性能的同时,保持了强大的单图推理能力,推动了整体视觉偏好对齐技术的发展。

AI 推荐理由

论文核心解决多图像推理能力缺口,提出分层推理框架显著提升全局搜索与跨图比较性能。

研究机构
Michigan State University Carnegie Mellon University
论文信息
作者 Nitish Shukla, Surgan Jandial, Arun Ross
发布日期 2026-04-20
arXiv ID 2604.18512
相关性评分 9/10 (高度相关)