摘要
基于强化学习的后训练是提升大语言模型推理能力的关键方法,但其 token 级学习信号尚不明确。本文通过注意力熵研究其异质性,发现低熵 token(锚点)提供稳定优化基础,高熵 token(探索者)蕴含困难推理信号但梯度波动大。据此提出的动态熵感知重加权策略,显著提升了 Qwen3-8B-Base 在推理基准上的表现,证明均匀 token 平均会掩盖推理后训练中的重要异构结构。
AI 推荐理由
论文核心研究基于 RL 的推理后训练机制,通过注意力熵揭示 token 级学习信号异质性。
研究机构
北京大学计算机科学与技术学院
北京大学软件与微电子学院
论文信息