Data Selection Reasoning CoT Training Efficiency
摘要

训练大语言模型进行复杂长思维链推理常受限于高质量数据稀缺。现有方法计算成本高或难以区分数据质量。本文提出高熵和(HES),一种无需训练的指标,通过累加推理样本中最高熵令牌来量化质量。实验表明,在监督微调、拒绝微调和强化学习三种范式中,HES 均能显著降低计算开销并提升性能。仅用前 20% 的高分数据即可匹敌全量数据效果,确立了其作为高效推理开发方法的鲁棒性。

AI 推荐理由

论文核心提出 HES 指标以筛选高质量推理数据,直接提升 LLM 复杂推理能力。

研究机构
University of Science and Technology of China Alibaba Group
论文信息
作者 Xiaoyuan Li, Yubo Ma, Chengpeng Li, Fengbin Zhu, Yiyao Yu et al.
发布日期 2026-05-21
arXiv ID 2605.22389
相关性评分 9/10 (高度相关)