摘要
针对多轮智能体强化学习中奖励稀疏与信用分配不匹配的问题,本文提出 StepOPSD 框架。该方法以“步骤”为信用重分配单元,将轨迹分解为以行动为中心的片段,利用后见之明丰富的教师上下文重新评分,并将令牌级概率差距转化为保符号的优势塑造。在 ALFWorld 和 Search-QA 基准测试中,StepOPSD 在局部因果错误敏感的任务子集上取得了最佳或次佳成绩,证明了步骤感知蒸馏在轨迹级奖励与局部动作对齐较弱时的有效性。
AI 推荐理由
论文提出基于强化学习的自我改进框架,通过步骤级偏好蒸馏优化 Agent 策略,属于核心自我进化研究。
研究机构
Independent Researcher
Tencent
DeepWisdom
论文信息