摘要
针对现有强化学习算法仅在轨迹层面进行策略优化,导致长程任务中奖励稀疏及信用分配困难的问题,本文提出状态分数监督策略优化(3SPO)。该算法利用历史成功率计算动态状态分数,实现步级信用分配与策略优化,无需价值函数估计。理论分析证明了其低遗憾界与样本复杂度保证。在 ALFWorld 和 WebShop 上的实验表明,3SPO 显著优于 GRPO,同时提升了状态探索效率与收敛速度。
AI 推荐理由
提出 3SPO 算法优化长程任务中的步级信用分配与策略,核心解决多步规划难题。
研究机构
School of Computer Science and Technology, East China Normal University
论文信息