摘要
强化学习后训练在解锁大语言模型的推理、自我反思及工具使用能力方面成效显著。面对全模态输入与智能体多轮工作流,现有系统面临数据流异构、大规模运行鲁棒性及陈旧度与吞吐量权衡三大挑战。本文提出 Relax,一个开源强化学习训练引擎,通过三层协同设计架构解决上述问题:原生全模态架构、故障隔离的独立服务角色以及基于异步数据总线的解耦训练。实验表明,Relax 在多种模式下显著加速训练收敛,并支持视频等复杂模态的稳定训练,有效推动了模型能力的自我进化。
AI 推荐理由
论文核心是构建支持智能体自我反思、工具使用等能力进化的大规模强化学习训练引擎。
研究机构
AI Platform, Xiaohongshu Inc
The University of Hong Kong
University of Science and Technology of China
论文信息