Reinforcement Learning Mechanistic Interpretability Reasoning Generalization Post-training
摘要

基于强化学习(RL)的后训练常能提升大语言模型在训练域外的推理性能,而监督微调(SFT)则易导致通用能力遗忘。本文提出一种特征级机制分析方法,在控制实验下对比 RL 与 SFT 模型的内部激活演化。研究发现,SFT 快速引入高度特化特征,而 RL 诱导更克制且持续演变的特征变化,保留了基座模型表征。研究识别出一组紧凑的、任务无关的特征直接介导跨任务泛化,干预实验证实了其因果作用:禁用这些特征显著降低泛化性能,增强则提升基座模型表现。

AI 推荐理由

论文核心研究 RL 如何提升 LLM 推理泛化能力的特征级机制,属推理能力核心研究。

研究机构
TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China German Research Center for Artificial Intelligence (DFKI), Saarbrücken, Germany
论文信息
作者 Dan Shi, Zhuowen Han, Simon Ostermann, Renren Jin, Josef van Genabith et al.
发布日期 2026-04-27
arXiv ID 2604.25011
相关性评分 9/10 (高度相关)