Chain-of-Thought Safety Monitoring Small Language Models Hidden Objectives Reinforcement Learning
摘要

监控推理模型的思维链(CoT)是检测代码生成中隐蔽恶意行为的有效手段,但大模型部署成本高昂。针对小模型难以识别隐藏目标的问题,本文提出结合监督微调与强化学习的后训练流程,通过蒸馏强监控者行为及针对高难度样本的强化学习,提升小模型的泛化能力。实验表明,4B 参数的 CoT-Guard 在提示和代码操纵攻击下表现优异,G-mean 达 75%,超越 GPT-5.4 等大模型,为低成本用户侧防御提供了实用方案。

AI 推荐理由

论文核心在于监控思维链(CoT)以检测推理过程中的隐藏目标,紧密围绕推理机制的安全性与可解释性展开。

研究机构
University of Illinois Urbana-Champaign Capital One
论文信息
作者 Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty et al.
发布日期 2026-05-12
arXiv ID 2605.12746
相关性评分 8/10 (高度相关)