摘要
针对现有图像编辑模型在复杂推理任务上的不足,本文提出 DDA-Thinker 框架。该框架采用以“思考者”为中心的模式,将规划模块与固定生成模型解耦,以独立优化任务规划能力。我们引入双原子强化学习机制,通过可验证清单将反馈分解为评估计划质量的认知原子奖励和评估最终图像质量的视觉原子奖励。此外,构建了包含数据合成与难度感知精炼的两阶段数据流水线。实验表明,该方法在推理驱动基准上显著提升了性能,使开源模型达到媲美专有模型的效果。
AI 推荐理由
论文核心提出以规划模块(Thinker)为中心的框架,专注于推理驱动的图像编辑任务规划与分解。
研究机构
中国科学院自动化研究所
论文信息