Self-Improving Trust Layer AI Safety Semantic Threats RAG
摘要

针对 AI 代理执行关键动作时的信任问题,本文提出 AgentTrust,一种能自我进化的信任层。研究指出基于固定规则的防御无法应对语义威胁,而引入具备自学习能力的 LLM 评判者可显著提升准确率。该系统采用双存储架构:将词法威胁蒸馏为确定性规则以降低成本,同时利用受保护的 RAG 记忆积累语义威胁的先例。实验表明,该系统能从决策流中自我演化,在降低调用频率的同时提升领域准确率,且无误阻良性动作。

AI 推荐理由

论文核心提出自我改进的信任层,通过自学习机制持续进化规则与记忆,显著提升安全性。

研究机构
Independent Researcher
论文信息
作者 Chenglin Yang
发布日期 2026-06-07
arXiv ID 2606.08539
相关性评分 9/10 (高度相关)