Visual Reasoning Instruction Tuning Self-Supervised Learning MLLM
摘要

多模态大语言模型在视觉中心任务中常因过度依赖语言先验而表现不佳。本文提出一种轻量级方法,将旋转预测等经典自监督任务重构为自然语言指令三元组,融入视觉指令微调。该方法无需人工标注或架构修改,仅注入少量(3-10%)视觉接地指令,即可在多基准测试中显著提升模型的细粒度视觉推理性能,证明了调整训练数据分布是增强视觉推理的有效途径。

AI 推荐理由

论文核心解决多模态模型视觉推理不足问题,通过自监督任务增强细粒度视觉推理能力。

研究机构
Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France Institut universitaire de France (IUF)
论文信息
作者 Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris
发布日期 2026-04-14
arXiv ID 2604.12966
相关性评分 9/10 (高度相关)