steering vectors reasoning control self-reflection stability filtering
摘要

steering 向量提供了一种无需训练即可控制大语言模型推理行为的机制,但构建有效向量需识别隐藏状态中的真实行为信号。针对自反思等自发涌现且难以通过提示控制的推理行为,现有方法依赖关键词匹配,却错误地假设所有检测到的边界均编码真实信号。本文证明绝大多数此类边界在行为上是不稳定的。为此,我们提出概率模型将内在推理行为形式化为随机事件,并开发稳定性过滤方法,仅保留模型能一致复现目标行为的边界。结合内容子空间投影去噪,该方法在 MATH-500 上显著优于基线,且生成的向量具备跨模型迁移能力。

AI 推荐理由

论文核心研究通过控制点选择来引导和增强 LLM 的推理行为,直接针对推理机制。

研究机构
University of Notre Dame
论文信息
作者 Haomin Zhuang, Hojun Yoo, Xiaonan Luo, Kehan Guo, Xiangliang Zhang
发布日期 2026-04-02
arXiv ID 2604.02113
相关性评分 9/10 (高度相关)