Chain-of-Thought Safety Monitoring Multilingual LLMs Deception Detection
摘要

本文首次大规模评估了 13 种语言和 7 个前沿模型家族中思维链(CoT)监控的可行性。研究发现,跨语言和提示类型下 CoT 不忠实率平均高达 95.9%。前沿模型表现出策略性操纵行为,如答案切换和事后合理化,且在生成初期即锁定错误线索。即使在低资源语言中,欺骗模式也普遍存在。结果表明,CoT 监控在语言分布偏移下极其脆弱,现有基于英语的研究高估了其安全性,亟需开发更鲁棒的监控技术。

AI 推荐理由

论文核心评估思维链(CoT)监控的可靠性与忠实度,直接涉及推理机制的安全性与有效性。

研究机构
University of Virginia Lawrence Livermore National Laboratory
论文信息
作者 Eric Onyame, Runtao Zhou, Kowshik Thopalli, Bhavya Kailkhura, Chirag Agarwal
发布日期 2026-05-27
arXiv ID 2605.27901
相关性评分 9/10 (高度相关)