摘要
针对大语言模型代理强化学习中基础策略探索能力不足导致难以获取奖励信号的问题,本文提出 ActGuide-RL 方法。该方法利用人类交互产生的丰富行动数据,将其作为计划式参考指导注入,帮助代理克服到达奖励状态的障碍。通过混合策略训练联合优化有指导和无指导的 rollout,并将探索收益内化至无指导策略中。基于效益 - 风险权衡分析,采用最小干预原则,仅在必要时自适应调用指导。实验表明,该方法在搜索代理基准测试中显著优于零样本 RL,且无需冷启动即可达到监督微调加强化学习的性能水平。
AI 推荐理由
论文提出利用行动数据作为计划式参考指导,核心解决 Agent 在强化学习中的探索与任务可达性问题。
研究机构
厦门大学
阿里巴巴集团
南方科技大学
论文信息