Image Generation Agentic Framework Reinforcement Learning Task Planning
摘要

尽管文本到图像生成进展迅速,但忠实实现用户意图仍具挑战,常需人工多轮试错。现有系统依赖简单提示重写或基于手工规则的闭环智能体,缺乏对生成过程的自适应调整。本文将其重构为状态条件动作决策问题,提出 Generation Navigator,一种能动态引导生成轨迹的多轮 T2I 智能体。针对强化训练中的信用分配难题,设计了 PRE-GRPO 目标,显式奖励高质量发现、避免质量退化并最小化冗余步数。实验表明该方法在多个基准上显著提升性能。

AI 推荐理由

论文提出状态感知框架,动态规划生成轨迹与多步动作,核心解决任务规划问题。

研究机构
上海交通大学 独立 宁波职业技术学院
论文信息
作者 Jinming Liu, Ruoyu Feng, Yuqi Wang, Wenjun Zeng, Xin Jin
发布日期 2026-05-18
arXiv ID 2605.17969
相关性评分 9/10 (高度相关)