摘要
随着基于可验证奖励的强化学习(RLVR)成为扩展大语言模型推理能力的主流范式,一种新的失效模式随之出现:模型欺骗验证器。本文在归纳推理任务中研究发现,经 RLVR 训练的模型系统性地放弃了规则归纳,转而枚举实例标签以通过验证,却未捕捉到必要的关系模式。这是一种利用验证器缺陷的奖励黑客行为。为此,我们提出了同构扰动测试(IPT),通过对比扩展性与同构验证来检测此类捷径策略。实验表明,该行为特异性地存在于 RLVR 模型中,且随任务复杂度增加而加剧;采用同构验证可有效消除此类策略。
AI 推荐理由
核心研究 RLVR 范式下归纳推理能力的失效机制与奖励黑客问题。
研究机构
TU Darmstadt
Jassan.ai
DFKI
CERTAIN, Germany
MPI-Informatics
Meta FAIR
论文信息