摘要
针对现有技能增强强化学习方法未能在存储前评估新生成技能有效性的问题,本文提出一种在线预存储验证框架。该框架通过对比基准 rollout 与技能增强 rollout 的奖励差距,估算候选技能的上下文相关边际效用,从而在不增加额外开销的情况下过滤无效或有害技能。此外,利用该效用信号训练策略模型作为技能生成器,减少了对专有模型的依赖,并支持检索重排序及过时技能剪枝,实现技能的协同演化。
AI 推荐理由
论文核心提出技能生成与验证框架,解决技能库中低效技能过滤及策略优化问题。
研究机构
The Pennsylvania State University
Nanyang Technological University
University of California, San Diego
University of Utah
Harvard University
论文信息