摘要
Agent 技能虽能复用资源与工作流,但也为恶意行为提供了隐蔽空间。静态审查难以检测仅在特定运行时条件下触发的危害。本文提出运行时技能审计(RSA),一种通过分析技能在定向运行条件下的实际行为来进行动态分析的方法。RSA 通过剖析风险相关接口、构建执行上下文并依据追踪证据分配安全标签,实现了对技能的精准评估。实验表明,RSA 在准确率及对抗自我进化攻击方面显著优于现有静态基线方法。
AI 推荐理由
论文核心研究 Agent 技能的安全审计机制,直接针对技能调用时的动态行为分析。
研究机构
约翰霍普金斯大学
论文信息