Reasoning Traces Knowledge Distillation Prompt Engineering Model Security
摘要

推理痕迹已成为提升和迁移大语言模型能力的重要学习信号,尤其有助于将强教师模型的推理行为蒸馏至弱学生模型。鉴于许多部署系统为保护内部机制而隐藏原始推理痕迹,本文探讨了用户是否仍能通过提示获取有效的推理监督。我们提出了“推理暴露提示”(REP)方法,利用影子模型生成的演示及辅助代码格式,从目标模型中提取用户可见的推理痕迹。实验表明,REP 显著提高了暴露痕迹与内部痕迹的相似度,同时保留了关键的推理信号。

AI 推荐理由

论文核心研究 LLM 推理痕迹的暴露与提取,直接针对推理能力的监督信号获取。

研究机构
National Yang Ming Chiao Tung University UC Berkeley
论文信息
作者 Yu-An Lu, Ci-Yang Tsai, Yu-Lin Tsai, Raluca Ada Popa, Chia-Mu Yu
发布日期 2026-05-30
arXiv ID 2606.00642
相关性评分 9/10 (高度相关)