safety reasoning chains harm detection benchmark LLM safety
摘要

大型推理模型(LRMs)生成复杂的多步推理轨迹,但现有安全评估仅关注最终输出,忽视了危害在推理过程中如何逐步显现。本文提出 HarmThoughts 基准,用于对推理轨迹进行细粒度的逐句安全评估。该数据集包含来自四个模型家族的 1018 条推理轨迹,共 56,931 个句子,并标注了 16 类有害推理行为。研究分析了危害传播模式及从安全到不安全的关键转折点,并系统比较了白盒与黑盒检测器在识别此类行为上的表现,发现现有方法在细粒度检测上存在显著不足。

AI 推荐理由

论文核心研究推理链中的有害行为检测,聚焦推理过程的安全性与行为演化机制。

研究机构
Department of Computer Sciences, University of Wisconsin-Madison
论文信息
作者 Ishita Kakkar, Enze Zhang, Rheeya Uppaal, Junjie Hu
发布日期 2026-04-21
arXiv ID 2604.19001
相关性评分 9/10 (高度相关)