摘要
针对大型 3D 视觉语言模型计算成本高难以部署的问题,本文提出一种知识蒸馏框架,将 7B 教师模型的空间推理能力迁移至 2.29B 学生模型。该方法在降低推理延迟和模型规模的同时,保留了教师模型大部分性能。为在无思维链数据下提升推理能力,创新性地引入“隐藏思维链”,利用可学习潜令牌作为内部草稿板。实验表明,该框架在资源受限平台上实现了高效的 3D 场景问答与空间理解。
AI 推荐理由
论文核心在于通过知识蒸馏和隐藏思维链提升模型的 3D 空间推理能力。
研究机构
Department of Computer Science, Toronto Metropolitan University, Toronto, ON, Canada
论文信息