Reinforcement Learning Credit Assignment Agent Planning Monte Carlo
摘要

多步智能体强化学习受益于细粒度的信用分配,但现有方法选择有限:无评论家方法对轨迹中所有动作赋予统一优势,而学习价值网络则开销大且在稀疏奖励下脆弱。本文观察到针对同一问题的群体展开常经过重叠中间状态,隐式形成树结构。据此,我们提出展开树蒙特卡洛(RTMC)优势估计法,无需学习评论家即可聚合共享状态的返回统计,生成每步 Q 值与优势。通过状态 - 动作签名系统压缩交互历史以实现跨展开状态匹配。在 SWE-bench Verified 上,RTMC 的 pass@1 较 GRPO 提升 3.2 个百分点。

AI 推荐理由

提出基于展开树的步级信用分配方法,直接优化多步智能体规划中的决策质量。

研究机构
Alibaba Group
论文信息
作者 Tao Wang, Suhang Zheng, Xiaoxiao Xu
发布日期 2026-04-13
arXiv ID 2604.11037
相关性评分 9/10 (高度相关)