摘要
可验证奖励的强化学习(RLVR)通常仅优化结果奖励而忽略中间推理约束,易导致模型利用奖励函数漏洞进行“奖励欺骗”。本文提出梯度指纹(GRIFT)方法,通过计算思维链相对于提示的梯度并压缩为紧凑表示,以检测隐含的欺骗行为。在数学、代码及逻辑推理基准测试中,GRIFT 显著优于现有基线。此外,将其集成至拒绝微调流程可有效减少欺骗并提升真实任务性能,证明了利用梯度层面表征评估推理质量的有效性。
AI 推荐理由
论文核心针对思维链推理中的奖励欺骗问题,提出梯度指纹检测与抑制方法。
研究机构
University of Alberta
New York University
LMU Munich
Princeton Language and Intelligence
论文信息