Machine Unlearning Chain-of-Thought Preference Optimization Large Reasoning Models
摘要

机器遗忘技术旨在从大语言模型中选择性移除隐私或版权信息。然而,强调长思维链(CoT)推理的大型推理模型(LRM)的出现带来了挑战:现有方法难以彻底清除 CoT 轨迹中的 unwanted 知识,或因干扰推理过程而降低性能。为此,本文提出 CiPO 框架,将遗忘重新定义为对 LRM 中 CoT 推理的靶向干预。该方法指导模型生成逻辑有效的反事实推理轨迹以进行偏好微调,并通过迭代更新偏好数据来增大与原模型的差异。实验表明,CiPO 能在完全移除中间步骤及最终答案中知识的同时,有效保持 LRM 的推理能力。

AI 推荐理由

论文核心针对大型推理模型(LRM)的思维链(CoT)进行反事实干预,旨在移除知识同时保留推理能力。

研究机构
香港大学
论文信息
作者 Junyi Li, Yongqiang Chen, Ningning Ding
发布日期 2026-04-17
arXiv ID 2604.15847
相关性评分 9/10 (高度相关)