Chain-of-Thought 信息论 推理监控 模型训练 奖励黑客
摘要

基于Chain-of-Thought(CoT)的监控系统是利用大语言模型(LLM)分析推理轨迹以检测输出中可能具有特定属性(如代码生成中的测试破解行为)的系统。本文通过信息论分析指出,CoT与输出之间的非零互信息是实现CoT监控的必要但不充分条件。研究识别了两种可能导致实际监控性能下降的近似误差来源:信息差距(衡量监控器从CoT中提取信息的能力)和引导误差(衡量监控器对最优监控函数的逼近程度)。进一步提出通过针对性训练目标系统性提升CoT监控能力,并提出了两种互补方法:一种是基于“神谕”的方法,直接奖励模型生成能最大化监控准确率的CoT;另一种是更实用的无标签方法,通过最大化输出与CoT之间的条件互信息来提升监控效果。实验表明,这两种方法在多种环境中均显著提升了监控准确性,同时防止了CoT退化,从而缓解了任务奖励不完全指定时的奖励黑客问题。

AI 推荐理由

论文聚焦于Chain-of-Thought(CoT)的监控与改进,直接涉及LLM的推理能力及推理过程的可监测性。

研究机构
美国加州大学伯克利分校 高通公司AI研究部
论文信息
作者 Usman Anwar, Tim Bakker, Dana Kianfar, Cristina Pinneri, Christos Louizos
发布日期 2026-02-20
arXiv ID 2602.18297
相关性评分 9/10 (高度相关)