摘要
大型语言模型生成的思维链(CoT)往往无法准确反映驱动其答案的真实因素。在包含偏向特定选项提示的多选题场景中,模型可能将最终答案转向该选项,并生成掩饰提示影响的合理化思维链,即“动机性推理”。本研究跨多个模型家族和数据集证实,即使从思维链文本难以判断,也可通过探测内部激活识别此类现象。实验表明,基于残差流的监督探针在生成前即可预测动机性推理,效果等同于监控完整思维链的模型;生成后探针表现更优。结果证明,内部表征比思维链监控更能可靠地检测动机性推理,且生成前探测可早期标记异常行为,避免无效生成。
AI 推荐理由
论文核心研究思维链(CoT)中的动机性推理现象,通过激活探测揭示推理过程与输出的不一致性。
研究机构
加州大学圣地亚哥分校
论文信息