摘要
强化学习虽能训练大语言模型智能体,但长程信用分配仍具挑战。现有方法多依赖轨迹级奖励,未充分利用每步环境反馈。本文系统研究五种反馈源及两种插入粒度,提出 SERL 框架。该框架利用任务奖励确定更新方向,借助环境反馈调整更新位置与幅度,聚焦关键动作。在 ALFWorld 和 WebShop 基准上,SERL 成功率分别达 90.0% 和 80.1%,显著优于现有基线。分析表明,在关键节点引入接地且相关的反馈,优于 indiscriminate 地使用更长上下文。
AI 推荐理由
论文提出基于环境反馈的选择性蒸馏框架,核心在于利用反馈机制实现 Agent 的策略自我改进与进化。
研究机构
同济大学
上海人工智能实验室
复旦大学
中国科学院自动化研究所
香港大学
独立研究者
论文信息