Self-Distillation Long-Horizon Agents Reinforcement Learning Hindsight Analysis
摘要

针对长程大语言模型智能体在强化学习中因奖励稀疏而难以定位错误动作的问题,本文提出 HINT-SD 框架。该方法利用全轨迹事后分析,精准识别导致失败的关键动作片段,并仅对这些目标区间应用基于反馈的自我蒸馏。实验表明,相比密集的单轮反馈基线,该方法在提升性能高达 18.80% 的同时,将单步训练时间降低了 2.26 倍,证明了选择性蒸馏对高效训练长程智能体的关键作用。

AI 推荐理由

论文提出自我蒸馏框架,利用事后反思机制实现 Agent 的自我改进与训练优化。

研究机构
KAIST DeepAuto.ai
论文信息
作者 Woongyeng Yeo, Yumin Choi, Taekyung Ki, Sung Ju Hwang
发布日期 2026-05-18
arXiv ID 2605.17873
相关性评分 9/10 (高度相关)