摘要
训练大语言模型进行复杂长思维链推理常受限于高质量数据稀缺。现有方法计算成本高或难以区分数据质量。本文提出高熵和(HES),一种无需训练的指标,通过累加推理样本中最高熵令牌来量化质量。实验表明,在监督微调、拒绝微调和强化学习三种范式中,HES 均能显著降低计算开销并提升性能。仅用前 20% 的高分数据即可匹敌全量数据效果,确立了其作为高效推理开发方法的鲁棒性。
AI 推荐理由
论文核心提出 HES 指标以筛选高质量推理数据,直接提升 LLM 复杂推理能力。
研究机构
University of Science and Technology of China
Alibaba Group
论文信息