摘要
本文提出选择器引导的自主课程(SGAC)方法,旨在提升大语言模型在极少数据下的数学推理能力。针对现有基于奖励方差的启发式选择机制的局限性,该方法利用可学习的选择器模型,在包含成功概率、输出分歧及语义难度等多维特征空间动态筛选训练样本。实验表明,输出分歧比奖励方差更能预测推理增益。在 MATH 基准测试中,该框架显著优于现有最先进模型,证实了基于熵的智能数据策划能有效提升推理性能。
AI 推荐理由
论文核心在于通过自适应课程学习提升 LLM 的数学推理能力,直接针对推理性能优化。
研究机构
Department of Artificial Intelligence, Sardar Vallabhbhai National Institute of Technology, Surat, India
论文信息