摘要
红队测试对揭示大语言模型漏洞至关重要。针对现有方法依赖静态启发式或随机搜索的局限性,本文提出 Metis 框架,将越狱重构为对抗性部分可观测马尔可夫决策过程中的推理时策略优化。Metis 利用自我进化的元认知循环进行防御逻辑的因果诊断,并利用结构化反馈作为语义梯度来 refine 策略,提供透明的推理轨迹以增强可解释性。实验表明,Metis 在多种模型上实现了最高的平均攻击成功率,显著降低了 token 成本,揭示了当前防御在面对内部导向的闭环推理轨迹时的脆弱性。
AI 推荐理由
论文核心提出自我进化的元认知循环,通过因果诊断和反馈优化策略,属于典型的自我进化研究。
研究机构
University of Science and Technology of China
论文信息