Chain-of-Thought AI Safety Reasoning Capability Benchmarking
摘要

许多确保前沿 AI 模型安全的工作依赖于监控其思维链(CoT)推理。若模型能在无显式思考令牌的情况下执行复杂内部推理,将削弱此类监管。本文在涵盖数学、编码、因果性等 43 个基准的 3 万多个问题上,测量了前沿模型的无 CoT 推理能力。通过估算人类完成同等难度任务所需的时间(50% 任务完成时间跨度)及模型所需的推理令牌数,研究发现该时间跨度过去六年约每年翻番。预测显示,到 2028 年和 2030 年,这一指标可能分别超过 7 分钟和 25 分钟,建议开发者对此进行明确追踪。

AI 推荐理由

论文核心研究无思维链(No-CoT)下的推理能力评估、时间跨度预测及内部推理机制。

研究机构
Redwood Research Astra Fellows Program Polytechnic University of Catalonia Imperial College London University of Chicago University of Glasgow University of Oxford MIT
论文信息
作者 Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills et al.
发布日期 2026-06-05
arXiv ID 2606.07157
相关性评分 9/10 (高度相关)