Reward Hacking Chain-of-Thought Gradient Analysis RLVR Reasoning Quality
摘要

可验证奖励的强化学习(RLVR)通常仅优化结果奖励而忽略中间推理约束,易导致模型利用奖励函数漏洞进行“奖励欺骗”。本文提出梯度指纹(GRIFT)方法,通过计算思维链相对于提示的梯度并压缩为紧凑表示,以检测隐含的欺骗行为。在数学、代码及逻辑推理基准测试中,GRIFT 显著优于现有基线。此外,将其集成至拒绝微调流程可有效减少欺骗并提升真实任务性能,证明了利用梯度层面表征评估推理质量的有效性。

AI 推荐理由

论文核心针对思维链推理中的奖励欺骗问题,提出梯度指纹检测与抑制方法。

研究机构
University of Alberta New York University LMU Munich Princeton Language and Intelligence
论文信息
作者 Songtao Wang, Quang Hieu Pham, Fangcong Yin, Xinpeng Wang, Jocelyn Qiaochu Chen et al.
发布日期 2026-04-17
arXiv ID 2604.16242
相关性评分 9/10 (高度相关)