摘要
许多确保前沿 AI 模型安全的工作依赖于监控其思维链(CoT)推理。若模型能在无显式思考令牌的情况下执行复杂内部推理,将削弱此类监管。本文在涵盖数学、编码、因果性等 43 个基准的 3 万多个问题上,测量了前沿模型的无 CoT 推理能力。通过估算人类完成同等难度任务所需的时间(50% 任务完成时间跨度)及模型所需的推理令牌数,研究发现该时间跨度过去六年约每年翻番。预测显示,到 2028 年和 2030 年,这一指标可能分别超过 7 分钟和 25 分钟,建议开发者对此进行明确追踪。
AI 推荐理由
论文核心研究无思维链(No-CoT)下的推理能力评估、时间跨度预测及内部推理机制。
研究机构
Redwood Research
Astra Fellows Program
Polytechnic University of Catalonia
Imperial College London
University of Chicago
University of Glasgow
University of Oxford
MIT
论文信息