多模态推理 图像编辑基准 学科知识
摘要

统一多模态模型旨在联合理解、推理和生成,但现有图像编辑基准多局限于自然图像和浅层常识推理。本文提出 GRADE,首个评估图像编辑中学科知识与推理能力的基准,涵盖 10 个学术领域的 520 个样本。我们设计了多维评估协议,综合考察学科推理、视觉一致性和逻辑可读性。实验显示当前模型在隐含且知识密集的编辑场景中存在显著局限。GRADED 指出了统一多模态模型未来的关键发展方向。

AI 推荐理由

论文核心是评估多模态模型在图像编辑中的学科推理能力,直接聚焦推理机制。

研究机构
上海交通大学 南方科技大学 香港大学 复旦大学
论文信息
作者 Mingxin Liu, Ziqian Fan, Zhaokai Wang, Leyao Gu, Zirun Zhu et al.
发布日期 2026-03-12
arXiv ID 2603.12264
相关性评分 9/10 (高度相关)