Self-Reflection Visual Generation Agent Reinforcement Learning Co-Optimization
摘要

视觉内容生成已从单图像迈向多图像工作流,但现有智能体多为计划驱动,缺乏系统性反思机制以修正轨迹中的视觉错误。为此,本文提出 VisionCreator-R1,一种具备显式反思能力的原生视觉生成智能体,并引入“反思 - 计划协同优化”(RPCO)训练方法。研究发现强化学习中存在反思与计划优化的不对称性:计划可通过奖励可靠优化,而反思学习受噪声信用分配阻碍。基于此,RPCO 先在自建的 VCR-SFT 数据集上进行监督微调,再在 VCR-RL 数据集上通过强化学习协同优化。实验表明,该模型在现有基准及新提出的 VCR-bench 上均优于 Gemini2.5Pro。

AI 推荐理由

论文核心提出显式反思机制与自我优化训练方法,解决智能体中途错误修正问题。

研究机构
腾讯混元 香港科技大学
论文信息
作者 Jinxiang Lai, Wenzhe Zhao, Zexin Lu, Hualei Zhang, Qinyu Yang et al.
发布日期 2026-03-09
arXiv ID 2603.08812
相关性评分 9/10 (高度相关)