摘要
基于组的强化学习方法在提升大语言模型性能方面成效显著,并迅速扩展至智能体任务。然而,其信用分配严重依赖基于最终结果的粗粒度轨迹级归因,难以捕捉单步贡献,尤其是失败轨迹中被掩盖的关键步骤。为此,本文提出基于图的组策略优化(GraphGPO),首先将所有 rollout 轨迹聚合为统一的状态转移图,利用图中编码的全局信息估算各状态到任务目标的距离;随后,通过计算基于图的优势值,根据状态转移对缩短目标距离的贡献程度进行信用分配。该方法显著提升了训练效率,并在多个挑战性基准测试中取得了最先进性能。
AI 推荐理由
论文提出基于图的信用分配方法,优化 Agent 多步决策与任务规划中的步骤贡献评估。
研究机构
Nanyang Technological University, Singapore
Alibaba Group, Southbeach University, China
论文信息