摘要
针对现有静态奖励模型成本高且泛化能力差的问题,本文提出 RLAR 框架。该系统将奖励获取转化为动态工具合成与调用任务,利用 LLM 智能体自主检索最优奖励模型并生成程序化验证器。这使得奖励系统能在训练过程中随数据分布变化而自我进化。实验表明,RLAR 在数学、代码等任务上显著提升性能,并在 RewardBench-V2 上超越静态基线,展现了卓越的泛化能力。
AI 推荐理由
论文提出奖励系统能随数据分布变化自我进化,核心在于动态合成与自适应机制。
研究机构
清华大学
北京大学
论文信息