RLVR Mechanistic Interpretability Reasoning Sample Difficulty
摘要

可验证奖励强化学习(RLVR)能显著提升大语言模型的推理性能,但样本难度的机制作用尚不明确。本文通过难度分层分析发现,样本难度对 RLVR 具有非单调影响:简单和中等难度问题带来最稳定提升,而过难问题会导致退化行为。利用时序稀疏自编码器分析内部特征动态显示,不同难度问题激活不同的计算与推理特征。据此,作者提出针对难样本的难度自适应策略,通过反向推理重构和特征引导信号优化训练效果,揭示了样本难度是控制 RLVR 优化动态的关键因素。

AI 推荐理由

核心研究 RLVR 中样本难度对 LLM 推理能力的机制影响及优化策略。

研究机构
Beijing Jiaotong University AntGroup Northwestern Polytechnical University University of Leeds University of Southampton
论文信息
作者 Yue Cheng, Jiajun Zhang, Xiaohui Gao, Weiwei Xing, Zheng Wang et al.
发布日期 2026-05-27
arXiv ID 2605.28388
相关性评分 9/10 (高度相关)