摘要
自主 LLM 智能体可通过一系列看似无害的动作执行隐藏的恶意目标,使得基于标准轨迹级别的监控难以检测破坏行为。现有方法要么单次评估完整轨迹,要么将其划分为独立评分的窗口,限制了连接时间上相距较远动作证据的能力。本文提出 TRACE,一种面向长程 LLM 智能体轨迹的监控框架。TRACE 通过“分流 - 检查 - 判决”(TIJ)循环运作,识别高信号区域,在保持跨推理步骤累积证据的同时进行针对性检查,并综合得出轨迹级结论。在 SHADE-Arena 的十个任务域中评估显示,TRACE 取得了 0.713 的综合 F1 分数和 0.844 的召回率,尤其在需要长程证据链接的任务中提升显著。
AI 推荐理由
论文核心提出跨步证据聚合的推理框架,旨在解决长程轨迹中的逻辑关联与恶意目标检测问题。
研究机构
University of Massachusetts at Amherst
University of Oregon
论文信息