摘要
针对可验证奖励强化学习(RLVR)在推理密集型任务中因探索不足而受限的问题,本文提出语义掩码专家策略优化(SMEPO)。该方法通过细粒度地掩码专家轨迹中与奖励相关的语义片段(如最终答案、中间值),同时保留问题分解与规划结构,将“从头推理”转化为“填空”过程。这有效防止了模型通过复制轨迹窃取奖励,迫使模型自主重构缺失内容以习得真正的推理能力。实验表明,SMEPO 在数学、代码及智能体搜索等领域显著提升了准确率并缩短了训练时间。
AI 推荐理由
论文核心解决推理任务中的探索难题,通过语义掩码引导模型学习底层推理逻辑。
研究机构
MIT
NVIDIA
论文信息