摘要
针对现有使用工具的大语言模型安全系统固定单一协调拓扑的问题,本文将其视为实证系统问题进行研究。我们构建了一个包含 20 个交互目标(Web/API 与二进制)的受控基准测试,并在白盒与黑盒模式下评估了五种架构家族和三种模型家族共 600 次运行。结果显示,多智能体独立架构(MAS-Indep)验证检测率最高,而单智能体架构(SAS)效率最优。主要发现表明,更广泛的协调虽能提升覆盖率,但综合考虑延迟、令牌成本及利用验证难度后,其优势并非单调递增,存在成本 - 质量前沿的非单调性特征。
AI 推荐理由
论文核心研究多智能体协作拓扑与任务规划架构,评估不同规划策略对安全任务效果的影响。
研究机构
University College London
论文信息