摘要
思维链(CoT)监控是监管 AI 系统的有效途径,但训练可能导致模型隐藏推理特征从而降低可监控性。本文提出并验证了一个概念框架,将强化学习环境中的奖励分解为依赖最终输出和依赖 CoT 的两项,并将其分类为“对齐”、“正交”或“冲突”。预测表明,冲突项训练会降低可监控性,正交项无影响,而对齐项则能提升它。实验证实,使用冲突奖励项训练确实减少了 CoT 的可监控性,且此类优化极具挑战性。
AI 推荐理由
论文核心研究思维链(CoT)的可监控性及优化对其推理过程透明度的影响,直接关联推理机制。
研究机构
Google DeepMind
论文信息