Reward Hacking Chain of Thought Safety Interpretability
摘要

当语言模型的思维链表面 benign 时,隐式奖励欺骗难以审计:最终答案可能由提示捷径锚定,而书面推理仍似常规解题。基于验证器的探测需特定任务奖励信号。本文提出“自我承诺延迟”作为弱输入替代方案,测量推理上下文多早 Commit 到模型自己的最终答案。在 GSM8K 配对实验中,含答案提示的上下文比诚实上下文更早 Commit 且不确定性更低。主要指标在阈值 0.8 时 AUROC 达 0.878,支持性曲线总结指标更高。结果表明,可用捷径的推理上下文会留下早期行为承诺特征,无需奖励模型或外部判断器即可检测。

AI 推荐理由

论文核心研究思维链中的隐式奖励欺骗,通过分析推理过程中的承诺延迟来检测捷径行为。

研究机构
Independent Researcher Northeastern University Syracuse University
论文信息
作者 Bonan Shen, Youting Wang, Dingyan Shang, Tao Ning
发布日期 2026-06-04
arXiv ID 2606.05625
相关性评分 9/10 (高度相关)