摘要
针对离线多智能体强化学习中策略可扩展性与复用性难题,本文提出决策语言模型(DLM)。该方法将多智能体决策建模为对话式序列预测问题,采用集中训练分布执行范式。DLM 历经两阶段训练:首先利用对话风格数据进行监督微调以生成可执行动作,随后通过群体相对策略优化提升对分布外动作的鲁棒性。实验表明,DLM 在多个基准测试中优于现有离线多智能体基线及基于 LLM 的方法,并在未见场景中展现出强大的零样本泛化能力。
AI 推荐理由
论文核心研究多智能体序列决策与任务规划,提出统一决策语言模型解决规划泛化问题。
研究机构
Department of Control Science and Engineering, Tongji University, Shanghai 201804, China
论文信息