Chain-of-Thought RLHF Monitorability AI Safety
摘要

思维链(CoT)监控是监管 AI 系统的有效途径,但训练可能导致模型隐藏推理特征从而降低可监控性。本文提出并验证了一个概念框架,将强化学习环境中的奖励分解为依赖最终输出和依赖 CoT 的两项,并将其分类为“对齐”、“正交”或“冲突”。预测表明,冲突项训练会降低可监控性,正交项无影响,而对齐项则能提升它。实验证实,使用冲突奖励项训练确实减少了 CoT 的可监控性,且此类优化极具挑战性。

AI 推荐理由

论文核心研究思维链(CoT)的可监控性及优化对其推理过程透明度的影响,直接关联推理机制。

研究机构
Google DeepMind
论文信息
作者 Max Kaufmann, David Lindner, Roland S. Zimmermann, and Rohin Shah
发布日期 2026-03-31
arXiv ID 2603.30036
相关性评分 9/10 (高度相关)