Reinforcement Learning Code Generation Web Development Multimodal Reward
摘要

针对大语言模型在项目级网站生成中面临的挑战,本文提出 WebGen-R1,一种端到端的强化学习框架。该方法引入支架驱动的结构化生成范式以约束动作空间,并设计了级联多模态奖励机制,结合结构保证、执行反馈及视觉美学监督。实验表明,该框架能将 7B 基础模型转化为可部署的多页网站生成器,在功能成功率上媲美超大模型,且在渲染有效性和美学对齐方面表现更优,为小规模模型扩展至项目级应用提供了可行路径。

AI 推荐理由

论文核心研究利用强化学习提升 LLM 生成复杂项目级代码(网站)的技能,涉及工具使用与功能实现。

研究机构
The Hong Kong University of Science and Technology (Guangzhou) Tongyi Lab, Alibaba Group Electronics and Telecommunications Research Institute, Ant Group
论文信息
作者 Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim et al.
发布日期 2026-04-22
arXiv ID 2604.20398
相关性评分 9/10 (高度相关)