摘要
机器遗忘技术旨在从大语言模型中选择性移除隐私或版权信息。然而,强调长思维链(CoT)推理的大型推理模型(LRM)的出现带来了挑战:现有方法难以彻底清除 CoT 轨迹中的 unwanted 知识,或因干扰推理过程而降低性能。为此,本文提出 CiPO 框架,将遗忘重新定义为对 LRM 中 CoT 推理的靶向干预。该方法指导模型生成逻辑有效的反事实推理轨迹以进行偏好微调,并通过迭代更新偏好数据来增大与原模型的差异。实验表明,CiPO 能在完全移除中间步骤及最终答案中知识的同时,有效保持 LRM 的推理能力。
AI 推荐理由
论文核心针对大型推理模型(LRM)的思维链(CoT)进行反事实干预,旨在移除知识同时保留推理能力。
研究机构
香港大学
论文信息