Multimodal LLM Image Segmentation Comparative Reasoning Benchmark
摘要

针对多模态大模型在复杂查询图像分割中受限于训练数据及感知 - 生成模块鸿沟的问题,本文提出 Rea2Seg 两阶段框架。该方法首先基于注意力图发现候选掩码,随后利用 MLLM 对问题与候选进行对比推理并评分,将分割重构为“候选发现 + 判别选择”过程。此外,文章指出现有基准缺乏联合视觉观察与推理的挑战,遂推出 ReasonSeg-SGDR 新基准,涵盖判别识别、空间及几何等多维推理能力评估,并通过收集专用数据增强模型的联合理解与推理打分能力。

AI 推荐理由

论文核心提出基于比较推理的分割框架,并构建新基准评估多步与空间推理能力。

研究机构
MMLab, The Chinese University of Hong Kong
论文信息
作者 Xinyan Gao, Haoran Hao, Xiangyu Yue
发布日期 2026-06-08
arXiv ID 2606.09303
相关性评分 9/10 (高度相关)