Agent Safety Memory Mechanism Trajectory Authorization Distributed Attacks
摘要

本文针对现有确定性预执行安全门无法识别跨多步分解的分布式攻击问题,提出了会话风险记忆(SRM)。SRM 是一种轻量级确定性模块,通过维护代表代理会话行为演变的紧凑语义中心,并利用基线减法后的门输出指数移动平均来累积风险信号,从而实现轨迹级授权。该方法无需额外模型组件或训练。在包含慢速数据窃取等场景的基准测试中,SRM 实现了零误报和完美检测率,且单轮开销极低,确立了空间与时间授权一致性的概念区分。

AI 推荐理由

提出会话风险记忆机制,通过轨迹级授权解决分布式攻击,核心在于记忆架构。

研究机构
独立研究员,ILION项目
论文信息
作者 Florin Adrian Chitan
发布日期 2026-03-22
arXiv ID 2603.22350
相关性评分 9/10 (高度相关)