摘要
针对现有“先推理后行动”范式在复杂任务中探索受限及环境理解不全的问题,本文提出一种允许智能体同时与多个环境交互并共享跨轨迹经验的新范式。在此基础上,设计了 DPEPO 强化学习算法,通过两阶段训练(监督微调与分层奖励强化学习)鼓励多样化并行探索。该算法引入并行轨迹成功奖励及两种步级奖励,有效惩罚行为冗余并促进广泛探索。实验表明,DPEPO 在 ALFWorld 和 ScienceWorld 上取得了最先进的成功率,且效率与强基线相当。
AI 推荐理由
提出多环境并行探索范式与强化学习算法,核心解决任务规划中的探索局限问题。
研究机构
University of Electronic Science and Technology of China
DiDi
论文信息