摘要
基于Chain-of-Thought(CoT)的监控系统是利用大语言模型(LLM)分析推理轨迹以检测输出中可能具有特定属性(如代码生成中的测试破解行为)的系统。本文通过信息论分析指出,CoT与输出之间的非零互信息是实现CoT监控的必要但不充分条件。研究识别了两种可能导致实际监控性能下降的近似误差来源:信息差距(衡量监控器从CoT中提取信息的能力)和引导误差(衡量监控器对最优监控函数的逼近程度)。进一步提出通过针对性训练目标系统性提升CoT监控能力,并提出了两种互补方法:一种是基于“神谕”的方法,直接奖励模型生成能最大化监控准确率的CoT;另一种是更实用的无标签方法,通过最大化输出与CoT之间的条件互信息来提升监控效果。实验表明,这两种方法在多种环境中均显著提升了监控准确性,同时防止了CoT退化,从而缓解了任务奖励不完全指定时的奖励黑客问题。
AI 推荐理由
论文聚焦于Chain-of-Thought(CoT)的监控与改进,直接涉及LLM的推理能力及推理过程的可监测性。
研究机构
美国加州大学伯克利分校
高通公司AI研究部
论文信息