摘要
大型推理模型虽通过扩展思维链实现高精度,但往往产生过多冗余 token。本文提出“提示微调”(Hint Tuning),一种数据高效的方法,教导模型校准推理深度。该方法利用指令模型作为难度探针,自动构建包含无提示、稀疏提示和完整提示三种状态的训练数据。仅需 1000 个自标注样本,即可在主流推理模型上实现平均 31.5% 的 token 缩减,同时保持具有竞争力的基准测试准确率,无需大规模蒸馏数据集或昂贵的强化学习。
AI 推荐理由
论文核心提出 Hint Tuning 方法,旨在校准大模型的推理深度,显著减少冗余 token 并保持准确率。
研究机构
University of Electronic Science and Technology of China
Xiaohongsbu Inc.
National University of Singapore
论文信息