摘要
大型语言模型作为交互代理时,长程决策优化因方法反应式而受限。本文提出战略轨迹抽象(StraTA)框架,在代理强化学习中引入显式的轨迹级策略。该方法从初始状态采样紧凑策略,条件化后续动作,并通过分层 GRPO 风格滚动设计联合训练策略生成与执行。实验表明,StraTA 在 ALFWorld、WebShop 和 SciWorld 上显著提升了样本效率与最终性能,优于前沿闭源模型。
AI 推荐理由
论文提出轨迹级策略抽象,显式指导长程决策与行动,核心解决规划问题。
研究机构
The Chinese University of Hong Kong
Shanghai Artificial Intelligence Laboratory
University of Oxford
Shenzhen Loop Area Institute
University of Georgia
论文信息