Reinforcement Learning Long-Horizon Tasks Policy Optimization Agent Planning
摘要

基于组的强化学习(如 GRPO)提升了大语言模型在长程智能体任务上的表现。然而,现有的逐步组策略优化存在“上下文不一致”问题,导致优势估计严重偏差。为此,本文提出层级组策略优化(HGPO)方法。该方法根据历史上下文的一致性,将轨迹中的每一步分配至多个层级组,计算各组内的独立优势并通过自适应权重聚合。HGPO 在不增加额外模型或 rollout 的情况下实现了偏差 - 方差的有利权衡。在 ALFWorld 和 WebShop 任务上的实验表明,HGPO 显著优于现有方法。

AI 推荐理由

论文核心解决长程智能体任务中的策略优化问题,直接提升多步规划与目标导向行为能力。

研究机构
南京理工大学 东南大学
论文信息
作者 Shuo He, Lang Feng, Qi Wei, Xin Cheng, Lei Feng et al.
发布日期 2026-02-26
arXiv ID 2602.22817
相关性评分 9/10 (高度相关)