Multi-Agent Systems Credit Assignment Reinforcement Learning Long-horizon Tasks
摘要

记忆系统常以多智能体流水线形式增强大语言模型的长程任务能力。现有强化学习方法要么对所有智能体统一应用粗糙的最终奖励,要么依赖高成本的特定任务标注。为此,本文提出 TreeMem,无需额外标注即可从最终奖励中推导智能体特定的信用值。该方法将流水线扩展为树结构,通过蒙特卡洛平均估算各智能体对最终结果的贡献,将粗粒度奖励转化为细粒度优化信号,从而同步更新异构智能体策略。实验表明,该方法在长程基准测试中显著优于强基线。

AI 推荐理由

论文核心提出多智能体记忆系统的信用分配机制,直接优化记忆架构性能。

研究机构
中国科学院大学
论文信息
作者 Marina Mao, Alexandr Liu, Pengbo Li, Siheng Li, Bo Zhou et al.
发布日期 2026-05-06
arXiv ID 2605.04811
相关性评分 9/10 (高度相关)