摘要
统一多模态模型旨在联合理解、推理和生成,但现有图像编辑基准多局限于自然图像和浅层常识推理。本文提出 GRADE,首个评估图像编辑中学科知识与推理能力的基准,涵盖 10 个学术领域的 520 个样本。我们设计了多维评估协议,综合考察学科推理、视觉一致性和逻辑可读性。实验显示当前模型在隐含且知识密集的编辑场景中存在显著局限。GRADED 指出了统一多模态模型未来的关键发展方向。
AI 推荐理由
论文核心是评估多模态模型在图像编辑中的学科推理能力,直接聚焦推理机制。
研究机构
上海交通大学
南方科技大学
香港大学
复旦大学
论文信息