摘要
基于强化学习(RL)的后训练常能提升大语言模型在训练域外的推理性能,而监督微调(SFT)则易导致通用能力遗忘。本文提出一种特征级机制分析方法,在控制实验下对比 RL 与 SFT 模型的内部激活演化。研究发现,SFT 快速引入高度特化特征,而 RL 诱导更克制且持续演变的特征变化,保留了基座模型表征。研究识别出一组紧凑的、任务无关的特征直接介导跨任务泛化,干预实验证实了其因果作用:禁用这些特征显著降低泛化性能,增强则提升基座模型表现。
AI 推荐理由
论文核心研究 RL 如何提升 LLM 推理泛化能力的特征级机制,属推理能力核心研究。
研究机构
TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China
German Research Center for Artificial Intelligence (DFKI), Saarbrücken, Germany
论文信息