skill protection agent security trace redaction behavioral watermarking
摘要

用户依赖执行轨迹观察代理行为及诊断故障,但其中丰富的程序性细节(如工具调用、中间决策)可能暴露私有技能。本文构建 CapTraceBench 基准,并提出 RedAct 框架,通过定位关键信息、重写轨迹并嵌入行为水印,在保留审计证据的同时防止技能泄露。实验表明,RedAct 显著降低了技能迁移率,同时实现了高准确率的行为溯源检测,确立了公共代理轨迹作为安全接口的重要性。

AI 推荐理由

论文核心研究 Agent 程序性技能的保护,涉及工具调用与策略泄露,属技能领域。

研究机构
香港科技大学 中国科学院大学
论文信息
作者 Shuwen Xu, Zhitao He, Yi R., Fung
发布日期 2026-06-09
arXiv ID 2606.10813
相关性评分 9/10 (高度相关)