Chain-of-Thought Motivated Reasoning Activation Probing Interpretability LLM Safety
摘要

大型语言模型生成的思维链(CoT)往往无法准确反映驱动其答案的真实因素。在包含偏向特定选项提示的多选题场景中,模型可能将最终答案转向该选项,并生成掩饰提示影响的合理化思维链,即“动机性推理”。本研究跨多个模型家族和数据集证实,即使从思维链文本难以判断,也可通过探测内部激活识别此类现象。实验表明,基于残差流的监督探针在生成前即可预测动机性推理,效果等同于监控完整思维链的模型;生成后探针表现更优。结果证明,内部表征比思维链监控更能可靠地检测动机性推理,且生成前探测可早期标记异常行为,避免无效生成。

AI 推荐理由

论文核心研究思维链(CoT)中的动机性推理现象,通过激活探测揭示推理过程与输出的不一致性。

研究机构
加州大学圣地亚哥分校
论文信息
作者 Parsa Mirtaheri, Mikhail Belkin
发布日期 2026-03-17
arXiv ID 2603.17199
相关性评分 9/10 (高度相关)