Reinforcement Learning Self-Evolution Reward Modeling LLM Agents
摘要

针对现有静态奖励模型成本高且泛化能力差的问题,本文提出 RLAR 框架。该系统将奖励获取转化为动态工具合成与调用任务,利用 LLM 智能体自主检索最优奖励模型并生成程序化验证器。这使得奖励系统能在训练过程中随数据分布变化而自我进化。实验表明,RLAR 在数学、代码等任务上显著提升性能,并在 RewardBench-V2 上超越静态基线,展现了卓越的泛化能力。

AI 推荐理由

论文提出奖励系统能随数据分布变化自我进化,核心在于动态合成与自适应机制。

研究机构
清华大学 北京大学
论文信息
作者 Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo et al.
发布日期 2026-02-28
arXiv ID 2603.00724
相关性评分 9/10 (高度相关)