Privacy-Preserving Instruction Following Reasoning Traces LoRA
摘要

由推理模型驱动的 AI 代理需访问敏感用户数据,但其推理轨迹难以控制,可能导致隐私泄露。本文提出训练模型不仅在最终答案中,更在推理轨迹中遵循指令及约束。我们假设提升推理轨迹的指令遵循能力可增强隐私保护技能。为此,我们在包含明确推理限制的新数据集上微调模型,并引入利用独立 LoRA 适配器解耦推理与答案生成的策略。实验表明,该方法显著提升了指令遵循与隐私保护性能,尽管存在任务效用权衡,但为开发隐私感知代理提供了新方向。

AI 推荐理由

论文核心研究推理轨迹的可控性与指令遵循,直接针对推理模型的内部机制进行优化。

研究机构
德国达姆施塔特工业大学计算机科学系与德国国家应用网络安全研究中心(ATHENE) 阿联酋穆罕默德·本·扎耶德人工智能大学(Mohamed bin Zayed University of Artificial Intelligence, UAE)
论文信息
作者 Haritz Puerto, Haonan Li, Xudong Han, Timothy Baldwin, Iryna Gurevych
发布日期 2026-02-27
arXiv ID 2602.24210
相关性评分 9/10 (高度相关)