Reinforcement Learning LLM Agents Credit Assignment Long-horizon Planning
摘要

针对现有强化学习算法仅在轨迹层面进行策略优化,导致长程任务中奖励稀疏及信用分配困难的问题,本文提出状态分数监督策略优化(3SPO)。该算法利用历史成功率计算动态状态分数,实现步级信用分配与策略优化,无需价值函数估计。理论分析证明了其低遗憾界与样本复杂度保证。在 ALFWorld 和 WebShop 上的实验表明,3SPO 显著优于 GRPO,同时提升了状态探索效率与收敛速度。

AI 推荐理由

提出 3SPO 算法优化长程任务中的步级信用分配与策略,核心解决多步规划难题。

研究机构
School of Computer Science and Technology, East China Normal University
论文信息
作者 Yu Han, Kailing Li, Yang Jiao, Yulin Dai, Yuqian Fu et al.
发布日期 2026-06-08
arXiv ID 2606.09961
相关性评分 9/10 (高度相关)