摘要
针对复杂多实体场景中细粒度图像编辑的挑战,本文提出 InterCoG,一种新颖的文本 - 视觉交错式接地链推理框架。该方法首先在包含空间关系的文本中进行对象位置推理,明确推导编辑目标的位置与身份;随后通过生成边界框和掩码在像素空间进行视觉接地;最后重写编辑描述以指定预期结果。此外,本文提出了多模态接地重建监督和推理对齐两个辅助训练模块,并构建了 GroundEdit-45K 数据集及评估基准。实验证明该方法在空间复杂场景下具有优越的编辑精度。
AI 推荐理由
论文提出交错式接地推理框架,核心在于利用文本进行空间关系推导,属于典型的推理能力研究。
研究机构
哈尔滨工业大学-华为诺亚方舟实验室
论文信息