RLVR Semantic Masking Reasoning Expert Guidance
摘要

针对可验证奖励强化学习(RLVR)在推理密集型任务中因探索不足而受限的问题,本文提出语义掩码专家策略优化(SMEPO)。该方法通过细粒度地掩码专家轨迹中与奖励相关的语义片段(如最终答案、中间值),同时保留问题分解与规划结构,将“从头推理”转化为“填空”过程。这有效防止了模型通过复制轨迹窃取奖励,迫使模型自主重构缺失内容以习得真正的推理能力。实验表明,SMEPO 在数学、代码及智能体搜索等领域显著提升了准确率并缩短了训练时间。

AI 推荐理由

论文核心解决推理任务中的探索难题,通过语义掩码引导模型学习底层推理逻辑。

研究机构
MIT NVIDIA
论文信息
作者 Ruitao Liu, Qinghao Hu, Alex Hu, Yecheng Wu, Shang Yang et al.
发布日期 2026-05-24
arXiv ID 2605.25198
相关性评分 9/10 (高度相关)