Multi-Agent Systems Reinforcement Learning LLM Optimization Self-Improvement
摘要

针对现有基于大语言模型的多智能体系统依赖人工编排且缺乏统一强化学习优化的问题,本文提出 UnityMAS-O 框架。该框架将完整工作流作为优化单元,通过逻辑角色、图轨迹、自定义奖励及模型映射解耦智能体与参数,支持灵活的参数共享与多层级奖励分配。基于 Ray 架构实现分布式 PPO 更新,无需重写基础设施即可定义复杂工作流。实验表明,该方法在问答、搜索及代码生成任务中显著提升了多智能体系统的性能,尤其增强了小模型的适应能力。

AI 推荐理由

提出统一 RL 框架优化多智能体系统,实现自我改进与自适应,属核心进化研究。

研究机构
中国人民大学 小红书公司
论文信息
作者 Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu et al.
发布日期 2026-05-26
arXiv ID 2605.26646
相关性评分 9/10 (高度相关)