摘要
多模态生成模型在静态图像编辑任务中表现优异,但在需要动态推理的复杂场景中往往力不从心,难以建模从初始状态到最终状态的多步演化中间逻辑路径。为系统衡量这一关键局限,本文提出了 InEdit-Bench,这是首个专注于图像编辑中间路径推理的评估基准。该基准涵盖状态转换、动态过程、时间序列和科学模拟四类任务,并提出细粒度评估标准以检验逻辑连贯性、视觉自然度及约束遵循度。对 14 个代表性模型的评估揭示了该领域普遍存在的显著不足,旨在推动更具动态性和推理意识的多模态模型发展。
AI 推荐理由
论文核心聚焦于评估图像编辑中的中间逻辑路径推理能力,直接针对动态推理短板。
研究机构
中国科学院光电技术研究所
中国科学院大学
论文信息