摘要
现有 LLM 护栏常因整体阻断任务而牺牲良性部分,且缺乏对下游行为安全的评估。本文提出 TRIAD 框架,将护栏生成的言语反馈作为指导信号,融入 Agent 规划步骤。该模型经微调可输出“执行”、“拒绝”或“更新”决策及结构化反馈,引导 Agent 修订计划以规避有害组件并保留良性任务,形成护栏反馈与 Agent 规划的闭环。实验表明,TRIAD 显著降低了攻击成功率,并在安全与效用间取得了最佳平衡。
AI 推荐理由
论文核心在于利用护栏反馈引导 Agent 修正计划,实现安全与任务的平衡。
研究机构
墨尔本大学
论文信息