trajectory monitoring evidence aggregation LLM safety long-horizon reasoning
摘要

自主 LLM 智能体可通过一系列看似无害的动作执行隐藏的恶意目标,使得基于标准轨迹级别的监控难以检测破坏行为。现有方法要么单次评估完整轨迹,要么将其划分为独立评分的窗口,限制了连接时间上相距较远动作证据的能力。本文提出 TRACE,一种面向长程 LLM 智能体轨迹的监控框架。TRACE 通过“分流 - 检查 - 判决”(TIJ)循环运作,识别高信号区域,在保持跨推理步骤累积证据的同时进行针对性检查,并综合得出轨迹级结论。在 SHADE-Arena 的十个任务域中评估显示,TRACE 取得了 0.713 的综合 F1 分数和 0.844 的召回率,尤其在需要长程证据链接的任务中提升显著。

AI 推荐理由

论文核心提出跨步证据聚合的推理框架,旨在解决长程轨迹中的逻辑关联与恶意目标检测问题。

研究机构
University of Massachusetts at Amherst University of Oregon
论文信息
作者 Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli, Snigdha Ansu, Mohammadreza Teymoorianfard et al.
发布日期 2026-06-05
arXiv ID 2606.07054
相关性评分 9/10 (高度相关)