RLVR Distributional Shift Token-level Analysis Reasoning Mechanism
摘要

可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力,但其底层 Token 级机制尚不明确。本文通过系统实证研究,分析了基础模型与 RL 模型间的 Token 级分布偏移及其对序列推理性能的影响。研究发现,RL 微调仅引起高度稀疏且针对性的分布变化,少量关键 Token 决策直接决定了性能增益。通过交叉采样实验,证实插入少量 RL 采样 Token 即可恢复性能,反之则导致性能崩塌。此外,文章还探索了基于发散度的优势信号变体,为理解 RLVR 作为针对性精炼过程提供了细粒度视角。

AI 推荐理由

论文核心研究 RLVR 如何通过稀疏的 token 级分布变化提升 LLM 推理能力,深入剖析其机制。

研究机构
阿里巴巴集团
论文信息
作者 Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang et al.
发布日期 2026-03-23
arXiv ID 2603.22446
相关性评分 9/10 (高度相关)