Visual Agent Creative Planning End-to-End Learning Multimodal Generation
摘要

针对视觉内容创作对设计惯例及创意工作流的 nuanced 理解需求,本文提出 VisionCreator,一种原生视觉生成智能体模型。该模型在端到端可学习框架内统一了理解、思考、规划与创作(UTPC)能力。主要贡献包括:构建基于元认知的 VisGenData-4k 数据集;通过渐进式专项训练与虚拟强化学习优化模型;提出 VisGenBench 基准测试。实验表明,该模型在多步视觉创作任务中表现优于更大规模的闭源模型,为视觉生成智能体系统研究奠定基础。

AI 推荐理由

论文核心提出统一理解、思考、规划与创作的端到端框架,重点解决自主创意规划难题。

研究机构
腾讯混元 香港科技大学
论文信息
作者 Jinxiang Lai, Zexin Lu, Jiajun He, Rongwei Quan, Wenzhe Zhao et al.
发布日期 2026-03-03
arXiv ID 2603.02681
相关性评分 9/10 (高度相关)