摘要
强化学习通常依赖轨迹终端结果,难以分配中间步骤信用。针对现有自蒸馏方法在多轮设置中因反馈与决策上下文错位导致性能下降的问题,本文提出 HERO 框架。该方法利用后续环境观察作为局部对齐反馈,将每次交互转化为紧凑的轮次诊断,捕捉关于动作必要性或失败原因的可操作反馈。实验表明,HERO 在 TauBench 和 WebShop 上显著提升了任务成功率并减少了冗余步数,尤其在训练轮次受限场景下优于现有方法。
AI 推荐理由
论文提出 HERO 框架,利用事后反思进行自我蒸馏,核心在于 Agent 的自我改进与进化机制。
研究机构
University of California, San Diego
University of California, Berkeley
论文信息