摘要
针对文本到图像模型在实现复杂视觉意图时的挑战,本文提出了“概念鸿沟”概念,即语义承诺在生成生命周期中难以保持一致。为此,作者提出 SCOPE 框架,通过演进的结构化规范维护语义承诺,并条件式调用检索、推理和修复技能来解决未决或违反的承诺。实验表明,SCOPE 在 Gen-Arena、WISE-V 和 MindBench 基准上显著优于现有基线,证明了持久承诺跟踪对复杂图像生成的有效性。
AI 推荐理由
论文提出结构化分解与条件技能编排框架,核心在于任务规划与多步计划生成以解决复杂意图。
研究机构
MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China
The Hong Kong Polytechnic University
Nanyang Technological University
论文信息