摘要
大型语言模型常无差别处理数据,缺乏访问边界意识,易引发安全风险。现有策略依赖僵化防御或提示引导,难以实现细粒度动态授权。本文提出“授权链”(CoA)框架,将授权逻辑内化为模型核心能力。该方法要求在生成响应前,先产生包含资源审查、身份解析及决策阶段的显式授权推理轨迹。经监督微调,CoA 将策略执行与任务响应融合,使授权成为响应的因果前提。评估表明,CoA 在保持有用性的同时,能有效拒绝未授权访问,利用推理能力构建了主动安全机制。
AI 推荐理由
论文提出授权链框架,核心是将授权逻辑内化为显式的推理轨迹,依赖推理能力实现动态安全控制。
研究机构
清华大学计算机科学与技术系
香港科技大学数据科学与分析中心,信息 hub
论文信息