摘要
针对视觉内容创作对设计惯例及创意工作流的 nuanced 理解需求,本文提出 VisionCreator,一种原生视觉生成智能体模型。该模型在端到端可学习框架内统一了理解、思考、规划与创作(UTPC)能力。主要贡献包括:构建基于元认知的 VisGenData-4k 数据集;通过渐进式专项训练与虚拟强化学习优化模型;提出 VisGenBench 基准测试。实验表明,该模型在多步视觉创作任务中表现优于更大规模的闭源模型,为视觉生成智能体系统研究奠定基础。
AI 推荐理由
论文核心提出统一理解、思考、规划与创作的端到端框架,重点解决自主创意规划难题。
研究机构
腾讯混元
香港科技大学
论文信息