LLM Safety Agent Planning Guardrails Feedback Loop
摘要

现有 LLM 护栏常因整体阻断任务而牺牲良性部分,且缺乏对下游行为安全的评估。本文提出 TRIAD 框架,将护栏生成的言语反馈作为指导信号,融入 Agent 规划步骤。该模型经微调可输出“执行”、“拒绝”或“更新”决策及结构化反馈,引导 Agent 修订计划以规避有害组件并保留良性任务,形成护栏反馈与 Agent 规划的闭环。实验表明,TRIAD 显著降低了攻击成功率,并在安全与效用间取得了最佳平衡。

AI 推荐理由

论文核心在于利用护栏反馈引导 Agent 修正计划,实现安全与任务的平衡。

研究机构
墨尔本大学
论文信息
作者 Yuhao Sun, Jiacheng Zhang, Shaanan Cohney, Zhexin Zhang, Feng Liu et al.
发布日期 2026-06-04
arXiv ID 2606.05805
相关性评分 9/10 (高度相关)