摘要
针对长程大语言模型智能体在强化学习中因奖励稀疏而难以定位错误动作的问题,本文提出 HINT-SD 框架。该方法利用全轨迹事后分析,精准识别导致失败的关键动作片段,并仅对这些目标区间应用基于反馈的自我蒸馏。实验表明,相比密集的单轮反馈基线,该方法在提升性能高达 18.80% 的同时,将单步训练时间降低了 2.26 倍,证明了选择性蒸馏对高效训练长程智能体的关键作用。
AI 推荐理由
论文提出自我蒸馏框架,利用事后反思机制实现 Agent 的自我改进与训练优化。
研究机构
KAIST
DeepAuto.ai
论文信息