摘要
长程大语言模型智能体在漫长轨迹中产生安全证据,但稀疏、延迟及组合性的风险信号常逃逸局部审查。现有检测器难以在长程中可靠保留并聚合此类证据。本文重构长程安全检测为轨迹级证据压缩任务,提出 TRACE 方法。该方法采用“压缩器 - 读取器”架构:压缩器在轨迹级监督下将完整轨迹编码为紧凑的潜在证据状态,读取器则利用该状态作为安全参考来判定原始轨迹。此设计有效聚合分散的风险线索并减少证据过早丢失,在多个基准测试中显著优于现有基线。
AI 推荐理由
论文提出轨迹级证据压缩机制,核心解决长程对话中的记忆保留与风险聚合问题。
研究机构
University of Science and Technology of China
论文信息