Meta-RL Self-Evolution Research Agent Rubric-Guided
摘要

训练深度研究代理推动了强化学习超越可验证奖励的范畴。本文提出 RubricEM,一种基于准则引导的强化学习框架,结合阶段性策略分解与基于反思的元策略进化。该框架利用自生成准则结构化规划、证据收集及合成过程,并通过阶段结构化 GRPO 提供密集语义反馈。同时,训练共享骨干反射元策略,将已评估轨迹蒸馏为基于准则的可复用指导,显著提升长形式研究任务性能。

AI 推荐理由

论文核心提出基于反思的元策略进化机制,将过往轨迹蒸馏为可复用指导,实现自我改进。

研究机构
University of Illinois Urbana-Champaign
论文信息
作者 Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen et al.
发布日期 2026-05-11
arXiv ID 2605.10899
相关性评分 9/10 (高度相关)