Reinforcement Learning Long-horizon Planning Agent Strategy
摘要

大型语言模型作为交互代理时,长程决策优化因方法反应式而受限。本文提出战略轨迹抽象(StraTA)框架,在代理强化学习中引入显式的轨迹级策略。该方法从初始状态采样紧凑策略,条件化后续动作,并通过分层 GRPO 风格滚动设计联合训练策略生成与执行。实验表明,StraTA 在 ALFWorld、WebShop 和 SciWorld 上显著提升了样本效率与最终性能,优于前沿闭源模型。

AI 推荐理由

论文提出轨迹级策略抽象,显式指导长程决策与行动,核心解决规划问题。

研究机构
The Chinese University of Hong Kong Shanghai Artificial Intelligence Laboratory University of Oxford Shenzhen Loop Area Institute University of Georgia
论文信息
作者 Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr et al.
发布日期 2026-05-07
arXiv ID 2605.06642
相关性评分 9/10 (高度相关)