摘要
训练深度研究代理推动了强化学习超越可验证奖励的范畴。本文提出 RubricEM,一种基于准则引导的强化学习框架,结合阶段性策略分解与基于反思的元策略进化。该框架利用自生成准则结构化规划、证据收集及合成过程,并通过阶段结构化 GRPO 提供密集语义反馈。同时,训练共享骨干反射元策略,将已评估轨迹蒸馏为基于准则的可复用指导,显著提升长形式研究任务性能。
AI 推荐理由
论文核心提出基于反思的元策略进化机制,将过往轨迹蒸馏为可复用指导,实现自我改进。
研究机构
University of Illinois Urbana-Champaign
论文信息