摘要
人工智能代理已从被动预测工具演变为具备自主决策与环境交互能力的主动实体,这一转变由大语言模型的推理能力驱动。然而,这种进化引入了现有框架无法解决的关键安全漏洞。本文提出“层级自主进化”(HAE)框架,将代理安全划分为三个层级:认知自主(L1)关注内部推理完整性;执行自主(L2)涵盖工具介导的环境交互;集体自主(L3)解决多代理生态系统中的系统性风险。文章构建了包含认知操纵、物理环境破坏及多代理系统失效的威胁分类法,评估了现有防御措施并指出了关键研究空白,旨在指导可信 AI 代理系统的多层级、感知自主的防御架构开发。
AI 推荐理由
论文核心探讨 AI 代理的层级自主进化框架及其伴随的安全挑战,直接对应自我进化主题。
研究机构
南京航空航天大学,中国
中国协同创新中心新型软件技术与工业化,中国
中国科学院,中国
香港大学,中国
浙江大学,中国
华为,中国
浙江师范大学,中国
论文信息