摘要
基于大语言模型的多智能体系统(LLM-MAS)虽能协同解决复杂任务,但对工具输出的隐式信任构成了关键攻击面。现有工具攻击受限于领域特异性或静态模板。为此,本文提出 Evo-Attacker,将工具攻击构建为自进化、记忆增强的强化学习过程。该方法构建动态攻击记忆,利用审慎推理检索对抗模式并在关键时刻制定干预策略。此外,引入 Attack-Flow GRPO 通过终端结果优化中间推理步骤,解决长程信用分配难题。实验表明其泛化与进化能力显著优于基线。
AI 推荐理由
论文提出自我进化的攻击框架,核心机制为自进化强化学习与记忆增强。
研究机构
北京邮电大学
中国科学院信息工程研究所
论文信息