Hint Tuning Chain-of-Thought Efficiency Reasoning Depth
摘要

大型推理模型虽通过扩展思维链实现高精度,但往往产生过多冗余 token。本文提出“提示微调”(Hint Tuning),一种数据高效的方法,教导模型校准推理深度。该方法利用指令模型作为难度探针,自动构建包含无提示、稀疏提示和完整提示三种状态的训练数据。仅需 1000 个自标注样本,即可在主流推理模型上实现平均 31.5% 的 token 缩减,同时保持具有竞争力的基准测试准确率,无需大规模蒸馏数据集或昂贵的强化学习。

AI 推荐理由

论文核心提出 Hint Tuning 方法,旨在校准大模型的推理深度,显著减少冗余 token 并保持准确率。

研究机构
University of Electronic Science and Technology of China Xiaohongsbu Inc. National University of Singapore
论文信息
作者 Siqi Fan, Minghao Li, Xiaoqian Ma, Xiusheng Huang, Zhuo Chen et al.
发布日期 2026-05-09
arXiv ID 2605.08665
相关性评分 9/10 (高度相关)