RLVR Math Reasoning Curriculum Learning Data Curation
摘要

本文提出选择器引导的自主课程(SGAC)方法,旨在提升大语言模型在极少数据下的数学推理能力。针对现有基于奖励方差的启发式选择机制的局限性,该方法利用可学习的选择器模型,在包含成功概率、输出分歧及语义难度等多维特征空间动态筛选训练样本。实验表明,输出分歧比奖励方差更能预测推理增益。在 MATH 基准测试中,该框架显著优于现有最先进模型,证实了基于熵的智能数据策划能有效提升推理性能。

AI 推荐理由

论文核心在于通过自适应课程学习提升 LLM 的数学推理能力,直接针对推理性能优化。

研究机构
Department of Artificial Intelligence, Sardar Vallabhbhai National Institute of Technology, Surat, India
论文信息
作者 Rudray Dave, Vedang Dubey, Smit Deoghare, Sudhakar Mishra
发布日期 2026-05-03
arXiv ID 2605.01823
相关性评分 9/10 (高度相关)