Agent Security Semantic Under-specification Task Planning Risk Analysis
摘要

宿主代理承诺了便捷的交互模式,用户仅需指定目标,系统即可决定实现方式。然而,这种便利性引入了独特的安全问题:目标规范中的语义欠规范化。用户指令通常面向目标,却往往缺乏对过程约束、安全边界、持久性及暴露范围的充分界定。因此,代理必须在行动前补全缺失的执行语义,即便用户目标 benign,此补全过程也可能生成高风险的宿主端计划。本文构建了语义威胁模型,提出了语义诱导的风险补全模式分类法,并通过基于 OpenClaw 的案例研究与执行轨迹分析深入探讨了该现象。此外,文章还推导了使执行边界显式化及约束风险补全的防御设计原则。

AI 推荐理由

论文核心研究目标指令到可执行计划的语义补全机制及其安全风险,直接关乎规划能力。

研究机构
IEEE
论文信息
作者 Di Lu, Yongzhi Liao, Xutong Mu, Lele Zheng, Ke Cheng et al.
发布日期 2026-03-22
arXiv ID 2603.21231
相关性评分 9/10 (高度相关)