Multi-Agent Security Reinforcement Learning Self-Evolution Tool Attack
摘要

基于大语言模型的多智能体系统(LLM-MAS)虽能协同解决复杂任务,但对工具输出的隐式信任构成了关键攻击面。现有工具攻击受限于领域特异性或静态模板。为此,本文提出 Evo-Attacker,将工具攻击构建为自进化、记忆增强的强化学习过程。该方法构建动态攻击记忆,利用审慎推理检索对抗模式并在关键时刻制定干预策略。此外,引入 Attack-Flow GRPO 通过终端结果优化中间推理步骤,解决长程信用分配难题。实验表明其泛化与进化能力显著优于基线。

AI 推荐理由

论文提出自我进化的攻击框架,核心机制为自进化强化学习与记忆增强。

研究机构
北京邮电大学 中国科学院信息工程研究所
论文信息
作者 Bingyu Yan, Xiaoming Zhang, Jinyu Hou, Chaozhuo Li, Ziyi Zhou et al.
发布日期 2026-05-25
arXiv ID 2605.25389
相关性评分 9/10 (高度相关)