Multi-Agent Systems Offline RL Decision Making LLM
摘要

针对离线多智能体强化学习中策略可扩展性与复用性难题,本文提出决策语言模型(DLM)。该方法将多智能体决策建模为对话式序列预测问题,采用集中训练分布执行范式。DLM 历经两阶段训练:首先利用对话风格数据进行监督微调以生成可执行动作,随后通过群体相对策略优化提升对分布外动作的鲁棒性。实验表明,DLM 在多个基准测试中优于现有离线多智能体基线及基于 LLM 的方法,并在未见场景中展现出强大的零样本泛化能力。

AI 推荐理由

论文核心研究多智能体序列决策与任务规划,提出统一决策语言模型解决规划泛化问题。

研究机构
Department of Control Science and Engineering, Tongji University, Shanghai 201804, China
论文信息
作者 Zhuohui Zhang, Bin Cheng, Bin He
发布日期 2026-04-26
arXiv ID 2604.23557
相关性评分 9/10 (高度相关)