interpretability activation steering reasoning monitoring
摘要

近期研究表明,大语言模型将行为特质(“人格”)编码为激活空间中的线性方向。本文将其视为动态信号,在推理生成过程中监测和干预这些“人格向量”。我们提出“多方对话”概念,指代生成过程中人格向量与隐藏激活的时间序列对齐。实验显示,该特征能有效预测 MMLU-Pro 的正确率且具有可解释性。基于此,我们提出一种简单的段落条件干预方法,显著提升了多个模型的推理准确率,证明了阶段感知的潜在引导是推理时控制的有效方向。

AI 推荐理由

论文核心研究通过人格向量监测和干预推理过程,直接提升推理准确性。

研究机构
Technical University of Munich 'Helmholtz Munich' Munich Center for Machine Learning
论文信息
作者 Nils A. Herrmann, Leander Girrbach, Kirill Bykov, Zeynep Akata
发布日期 2026-05-09
arXiv ID 2605.09159
相关性评分 9/10 (高度相关)