摘要
大型语言模型智能体在动态环境中难以自主进化协调策略,主要因全局结果粗糙掩盖了局部策略优化所需的因果信号。本文将该瓶颈识别为多智能体信用分配问题,并提出 LangMARL 框架,将合作式多智能体强化学习中的信用分配与策略梯度进化引入语言空间。该方法首创智能体级语言信用分配及语言空间梯度进化机制,通过重放轨迹总结因果关系以提供密集反馈,显著提升了稀疏奖励下的收敛性与样本效率。
AI 推荐理由
论文核心解决多智能体策略自主进化问题,提出基于语言空间的梯度进化机制。
研究机构
Arizona State University
Cisco Research
University of North Carolina at Chapel Hill
论文信息