摘要
可验证奖励强化学习(RLVR)能显著提升大语言模型的推理性能,但样本难度的机制作用尚不明确。本文通过难度分层分析发现,样本难度对 RLVR 具有非单调影响:简单和中等难度问题带来最稳定提升,而过难问题会导致退化行为。利用时序稀疏自编码器分析内部特征动态显示,不同难度问题激活不同的计算与推理特征。据此,作者提出针对难样本的难度自适应策略,通过反向推理重构和特征引导信号优化训练效果,揭示了样本难度是控制 RLVR 优化动态的关键因素。
AI 推荐理由
核心研究 RLVR 中样本难度对 LLM 推理能力的机制影响及优化策略。
研究机构
Beijing Jiaotong University
AntGroup
Northwestern Polytechnical University
University of Leeds
University of Southampton
论文信息