摘要
大型语言模型智能体在复杂交互决策任务中表现优异,但现有方法依赖冗长的交互历史,导致计算成本高且扩展性受限。本文提出 STEP-HRL,一种分层强化学习框架,仅基于单步转移而非完整历史进行步级学习。该框架将任务分层结构化,利用已完成的子任务表征全局进度,并引入局部进度模块,迭代选择性地总结子任务内的交互历史以生成紧凑的局部进度摘要。这些组件共同为高层和低层策略生成增强的步级转移。在 ScienceWorld 和 ALFWorld 基准上的实验表明,STEP-HRL 在性能和泛化能力上显著优于基线,同时降低了令牌用量。
AI 推荐理由
提出分层强化学习框架,通过子任务结构化和局部进度总结优化多步任务规划。
研究机构
北京邮电大学
中国移动集团设计院有限公司
新加坡管理大学
论文信息