图像生成 任务规划 智能体架构 语义承诺
摘要

针对文本到图像模型在实现复杂视觉意图时的挑战,本文提出了“概念鸿沟”概念,即语义承诺在生成生命周期中难以保持一致。为此,作者提出 SCOPE 框架,通过演进的结构化规范维护语义承诺,并条件式调用检索、推理和修复技能来解决未决或违反的承诺。实验表明,SCOPE 在 Gen-Arena、WISE-V 和 MindBench 基准上显著优于现有基线,证明了持久承诺跟踪对复杂图像生成的有效性。

AI 推荐理由

论文提出结构化分解与条件技能编排框架,核心在于任务规划与多步计划生成以解决复杂意图。

研究机构
MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China The Hong Kong Polytechnic University Nanyang Technological University
论文信息
作者 Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng et al.
发布日期 2026-05-08
arXiv ID 2605.08043
相关性评分 9/10 (高度相关)