Reinforcement Learning Self-Verification Reward Modeling Agent Evolution
摘要

针对部分可验证任务,本文提出 Soft-RLVR 框架,将提示分解为原子需求清单,利用 LLM 验证器生成软奖励以优化模型。进一步引入 Soft-SVeRL,使策略兼具自我验证能力。研究揭示了自我验证易导致奖励膨胀的问题,并提出显式稳定机制以防止崩溃。实验表明,基于清单的软奖励显著提升指令遵循能力,且验证器质量与稳定性对强化学习效果至关重要。

AI 推荐理由

论文提出自我验证强化学习框架,核心在于 Agent 通过自我反思与奖励信号实现策略的自我改进与进化。

研究机构
Coherence Labs
论文信息
作者 Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee et al.
发布日期 2026-05-27
arXiv ID 2605.28561
相关性评分 9/10 (高度相关)