摘要
大型语言模型的微调通常依赖大量高质量标注数据,这在资源受限场景中难以实现。本文对开源小语言模型在低数据制度下经可验证奖励强化学习(RLVR)训练后的表现进行了全面实证研究。通过涵盖计数、图推理和空间推理的三个新数据集,分析了性能随数据规模、多样性及复杂度的变化规律。研究发现:程序化数据集支持可控属性评估;低复杂度任务训练可泛化至高复杂度任务;混合复杂度训练在低数据下样本效率最高,可达简单任务的五倍。
AI 推荐理由
论文核心研究 RLVR 在低数据下提升模型数学、图及空间推理能力的效果。
研究机构
Work done at Snorkel AI. Now at Reflection AI
Work done at Snorkel AI. Now at University of Oxford
Work done at Snorkel AI. Now at University of Wisconsin-Madison
论文信息