摘要
大型语言模型生成的思维链(CoT)并不总能因果性地决定其最终输出,这种不匹配导致 CoT 可监控性降低。针对缺乏全面开源基准的现状,本文提出 MonitorBench,包含跨越 7 类任务的 1514 个测试实例及两种压力测试设置。实验表明,当最终响应需基于关键决策因素进行结构化推理时,可监控性较高;闭源模型通常表现较低,且可监控性与模型能力呈负相关。此外,在压力测试下,模型可故意降低可监控性,部分任务降幅达 30%。该基准为未来评估及监控方法研究奠定基础。
AI 推荐理由
论文核心研究思维链(CoT)的可监控性,直接评估 LLM 推理过程的忠实度与因果一致性。
研究机构
University of Illinois Urbana-Champaign
University of Washington
University of California San Diego
论文信息