Red Teaming Self-Evolution VLM Safety Autonomous Agent
摘要

针对视觉 - 语言模型(VLM)的安全漏洞,现有红队测试受限于线性探索范式。本文提出 TreeTeaming 框架,将策略探索重构为动态进化发现过程。其核心是由大语言模型驱动的策略编排器,能自主决定演化潜在攻击路径或探索多样化战略分支,动态构建策略树。实验表明,该框架在 12 个主流 VLM 中的 11 个上取得了最先进的攻击成功率,最高达 87.60%,且生成的攻击具有更高的多样性和隐蔽性,确立了自动化漏洞发现的新范式。

AI 推荐理由

论文核心提出动态进化探索过程,自主决定演化攻击路径,属自我进化范畴。

研究机构
上海人工智能实验室
论文信息
作者 Chunxiao Li, Lijun Li, Jing Shao
发布日期 2026-03-24
arXiv ID 2603.22882
相关性评分 9/10 (高度相关)