摘要
大型语言模型与视觉语言模型虽具备强大推理能力,但在细粒度视觉编辑中常受限于空间理解与布局一致性。本文提出一种结构化推理框架,通过场景图推理执行文本条件的空间布局编辑。该模型基于输入场景图与自然语言指令进行推理,生成既满足文本条件又保持空间连贯性的更新场景图。通过显式引导结构化关系表示的推理过程,该方法提升了空间关系的可解释性与控制力。实验表明,相比基线方法,其在交并比与中心距离误差上均有显著改进。
AI 推荐理由
论文提出结构化推理框架,核心解决空间理解与布局一致性中的推理难题。
研究机构
NVIDIA
UMass Amherst
Umass Amherst
论文信息