摘要
大型推理模型(LRM)的思维链(CoT)为安全监控提供了新机遇,但其与最终输出的一致性常受质疑。本文通过探测 LRM 的隐藏表示,构建“探针轨迹”以捕捉概念概率在推理过程中的连续演化。研究发现,基于完整轨迹的分析比静态预测更能区分未来行为。通过提取波动性、趋势等信号处理特征,显著提升了状态分离度。此外,文章提出模板化训练数据可替代昂贵动态生成,并证实最大池化操作对获取稳定轨迹至关重要。实验表明,轨迹特征编码了特定任务动态,有效增强了 LRMs 行为监控能力。
AI 推荐理由
论文核心研究大型推理模型的思维链内部动态,通过探针轨迹分析推理过程,直接提升推理可解释性与监控。
研究机构
Faculty of Electronics and Information Technology, Warsaw University of Technology, Poland
NASK - National Research Institute, Poland
Faculty of Mathematics and Computer Science, Jagiellonian University, Poland
IDEAS Research Institute, Poland
Trooplos, Poland
论文信息