Chain of Thought Interpretability Safety Monitoring Probe Analysis Large Reasoning Models
摘要

大型推理模型(LRM)的思维链(CoT)为安全监控提供了新机遇,但其与最终输出的一致性常受质疑。本文通过探测 LRM 的隐藏表示,构建“探针轨迹”以捕捉概念概率在推理过程中的连续演化。研究发现,基于完整轨迹的分析比静态预测更能区分未来行为。通过提取波动性、趋势等信号处理特征,显著提升了状态分离度。此外,文章提出模板化训练数据可替代昂贵动态生成,并证实最大池化操作对获取稳定轨迹至关重要。实验表明,轨迹特征编码了特定任务动态,有效增强了 LRMs 行为监控能力。

AI 推荐理由

论文核心研究大型推理模型的思维链内部动态,通过探针轨迹分析推理过程,直接提升推理可解释性与监控。

研究机构
Faculty of Electronics and Information Technology, Warsaw University of Technology, Poland NASK - National Research Institute, Poland Faculty of Mathematics and Computer Science, Jagiellonian University, Poland IDEAS Research Institute, Poland Trooplos, Poland
论文信息
作者 Maciej Chrabąszcz, Aleksander Szymczyk, Marcin Sendera, Tomasz Trzciński, Sebastian Cygert
发布日期 2026-05-18
arXiv ID 2605.18549
相关性评分 9/10 (高度相关)