Reinforcement Learning Agent Training Omni-modal Self-Evolution System Architecture
摘要

强化学习后训练在解锁大语言模型的推理、自我反思及工具使用能力方面成效显著。面对全模态输入与智能体多轮工作流,现有系统面临数据流异构、大规模运行鲁棒性及陈旧度与吞吐量权衡三大挑战。本文提出 Relax,一个开源强化学习训练引擎,通过三层协同设计架构解决上述问题:原生全模态架构、故障隔离的独立服务角色以及基于异步数据总线的解耦训练。实验表明,Relax 在多种模式下显著加速训练收敛,并支持视频等复杂模态的稳定训练,有效推动了模型能力的自我进化。

AI 推荐理由

论文核心是构建支持智能体自我反思、工具使用等能力进化的大规模强化学习训练引擎。

研究机构
AI Platform, Xiaohongshu Inc The University of Hong Kong University of Science and Technology of China
论文信息
作者 Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li et al.
发布日期 2026-04-13
arXiv ID 2604.11554
相关性评分 9/10 (高度相关)