摘要
可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力,但其底层 Token 级机制尚不明确。本文通过系统实证研究,分析了基础模型与 RL 模型间的 Token 级分布偏移及其对序列推理性能的影响。研究发现,RL 微调仅引起高度稀疏且针对性的分布变化,少量关键 Token 决策直接决定了性能增益。通过交叉采样实验,证实插入少量 RL 采样 Token 即可恢复性能,反之则导致性能崩塌。此外,文章还探索了基于发散度的优势信号变体,为理解 RLVR 作为针对性精炼过程提供了细粒度视角。
AI 推荐理由
论文核心研究 RLVR 如何通过稀疏的 token 级分布变化提升 LLM 推理能力,深入剖析其机制。
研究机构
阿里巴巴集团
论文信息