Multi-Agent Debate Reinforcement Learning Reasoning Efficiency Dynamic Topology
摘要

本文提出 RUMAD 框架,将多智能体辩论中的动态通信拓扑控制建模为强化学习问题,旨在同时优化推理准确性、共识形成及计算效率。该方法采用内容无关的观测方案和多目标奖励机制,通过 PPO 训练的控制器动态调整通信图权重。实验表明,RUMAD 在多个基准测试中显著降低令牌成本(超 80%)并提升推理准确率,且展现出强大的零样本泛化能力,为资源受限下的多智能体推理应用提供了高效稳健的解决方案。

AI 推荐理由

论文核心是通过多智能体辩论机制增强 LLM 的推理能力,优化准确率与效率。

研究机构
清华大学 深圳,中国 浙江大学 杭州,中国
论文信息
作者 Chao Wang, Han Lin, Huaze Tang, Huijing Lin, Wenbo Ding
发布日期 2026-02-27
arXiv ID 2602.23864
相关性评分 9/10 (高度相关)