Reinforcement Learning Preference Distillation Agent Self-Improvement Credit Assignment
摘要

针对多轮智能体强化学习中奖励稀疏与信用分配不匹配的问题,本文提出 StepOPSD 框架。该方法以“步骤”为信用重分配单元,将轨迹分解为以行动为中心的片段,利用后见之明丰富的教师上下文重新评分,并将令牌级概率差距转化为保符号的优势塑造。在 ALFWorld 和 Search-QA 基准测试中,StepOPSD 在局部因果错误敏感的任务子集上取得了最佳或次佳成绩,证明了步骤感知蒸馏在轨迹级奖励与局部动作对齐较弱时的有效性。

AI 推荐理由

论文提出基于强化学习的自我改进框架,通过步骤级偏好蒸馏优化 Agent 策略,属于核心自我进化研究。

研究机构
Independent Researcher Tencent DeepWisdom
论文信息
作者 Yanfei Zhang, Xu Lin, Chenglin Wu
发布日期 2026-05-26
arXiv ID 2605.27140
相关性评分 9/10 (高度相关)