摘要
针对长程智能体任务中强化学习面临的信用误归因和样本低效两大挑战,本文提出里程碑引导策略学习框架 BEACON。该方法利用任务的组合结构,在里程碑边界分割轨迹,通过段内时序奖励重塑对部分进度进行精确信用分配,并采用双尺度优势估计防止远处失败干扰局部动作评估。在 ALFWorld 等基准测试中,BEACON 显著优于现有方法,尤其在长程任务上将成功率从 53.5% 提升至 92.9%,确立了基于里程碑的信用分配范式。
AI 推荐理由
论文核心解决长程任务中的序列决策与规划难题,通过里程碑机制优化信用分配。
研究机构
浙江大学
论文信息