Reinforcement Learning Reasoning Attention Entropy Token-level Optimization LLM Post-training
摘要

基于强化学习的后训练是提升大语言模型推理能力的关键方法,但其 token 级学习信号尚不明确。本文通过注意力熵研究其异质性,发现低熵 token(锚点)提供稳定优化基础,高熵 token(探索者)蕴含困难推理信号但梯度波动大。据此提出的动态熵感知重加权策略,显著提升了 Qwen3-8B-Base 在推理基准上的表现,证明均匀 token 平均会掩盖推理后训练中的重要异构结构。

AI 推荐理由

论文核心研究基于 RL 的推理后训练机制,通过注意力熵揭示 token 级学习信号异质性。

研究机构
北京大学计算机科学与技术学院 北京大学软件与微电子学院
论文信息
作者 Gengyang Li, Zheng-Fan Wu, Siqi Bao, Yunfang Wu
发布日期 2026-05-08
arXiv ID 2605.07660
相关性评分 9/10 (高度相关)