摘要
代理语言模型在安全机制上与聊天模型截然不同,其涉及规划、工具调用及长程动作执行,单步失误即可导致不可逆伤害。现有对齐方法因序列决策、对抗性反馈及过度自信的中间推理而失效。本文提出 MOSAIC,一种后训练框架,通过将安全决策显式化且可学习,实现安全的多步工具使用对齐。MOSAIC 将推理构建为“计划 - 检查 - 行动或拒绝”循环,赋予显式安全推理和拒绝作为首要动作的地位。该方法利用基于偏好的强化学习,无需轨迹级标签即可训练。实验表明,MOSAIC 在多个模型家族及分布外基准测试中,显著减少有害行为并提升拒绝率,同时保持良性任务性能。
AI 推荐理由
论文核心在于通过显式安全推理循环(计划 - 检查 - 行动/拒绝)来对齐 Agent 的多步推理过程,防止有害行为。
研究机构
微软研究
论文信息