Image Editing Logical Reasoning Benchmark Multimodal Models
摘要

多模态生成模型在静态图像编辑任务中表现优异,但在需要动态推理的复杂场景中往往力不从心,难以建模从初始状态到最终状态的多步演化中间逻辑路径。为系统衡量这一关键局限,本文提出了 InEdit-Bench,这是首个专注于图像编辑中间路径推理的评估基准。该基准涵盖状态转换、动态过程、时间序列和科学模拟四类任务,并提出细粒度评估标准以检验逻辑连贯性、视觉自然度及约束遵循度。对 14 个代表性模型的评估揭示了该领域普遍存在的显著不足,旨在推动更具动态性和推理意识的多模态模型发展。

AI 推荐理由

论文核心聚焦于评估图像编辑中的中间逻辑路径推理能力,直接针对动态推理短板。

研究机构
中国科学院光电技术研究所 中国科学院大学
论文信息
作者 Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding et al.
发布日期 2026-03-04
arXiv ID 2603.03657
相关性评分 9/10 (高度相关)