Reinforcement Learning Skill Discovery Language Agents Policy Optimization
摘要

针对现有技能增强强化学习方法未能在存储前评估新生成技能有效性的问题,本文提出一种在线预存储验证框架。该框架通过对比基准 rollout 与技能增强 rollout 的奖励差距,估算候选技能的上下文相关边际效用,从而在不增加额外开销的情况下过滤无效或有害技能。此外,利用该效用信号训练策略模型作为技能生成器,减少了对专有模型的依赖,并支持检索重排序及过时技能剪枝,实现技能的协同演化。

AI 推荐理由

论文核心提出技能生成与验证框架,解决技能库中低效技能过滤及策略优化问题。

研究机构
The Pennsylvania State University Nanyang Technological University University of California, San Diego University of Utah Harvard University
论文信息
作者 Zhiwei Zhang, Yudi Lin, Nikki Lijing Kuang, Linlin Wu, Xiaomin Li et al.
发布日期 2026-06-07
arXiv ID 2606.08755
相关性评分 9/10 (高度相关)