摘要
针对现有图像生成模型受限于静态内部知识、难以应对知识密集型场景的问题,本文提出了 Gen-Searcher,首个经过训练的搜索增强型图像生成代理。该代理通过多跳推理和搜索收集文本知识与参考图像,以实现基于事实的生成。研究构建了专用数据流水线及两个高质量数据集,并引入 KnowGen 基准进行评估。采用监督微调结合双奖励反馈的代理强化学习策略进行训练。实验表明,该方法在多个基准上显著提升了模型性能,为图像生成领域的搜索代理研究奠定了基础。
AI 推荐理由
论文核心在于训练代理执行多跳推理与搜索,以解决知识密集型图像生成任务。
研究机构
香港中文大学
加州大学洛杉矶分校
论文信息