摘要
大型推理模型(LRMs)虽通过生成长思维链(CoT)展现出强大性能,但常导致过度推理,产生冗余计算和循环自验证,增加成本却未提升结果。现有评估多关注最终准确率或粗略 token 数,缺乏自动化工具区分核心逻辑与结构冗余。本文提出 CoTJudger,一种基于图的框架,通过将自由形式 CoT 转化为有向依赖图并提取到达正确解所需的最短有效路径(SEP),量化推理效率。该框架提供了可解释的效率信号,能跨模型和任务比较 CoT 的必要性与冗余度。对 21 个 LRM 的评估揭示了普遍存在的冗余及“验证强迫”等失败模式,为解耦推理能力与计算浪费提供了实用指标。
AI 推荐理由
论文核心研究思维链(CoT)的效率与冗余评估,直接针对推理过程的优化与诊断。
研究机构
中国科学技术大学
ByteDance SEED
深圳大学
论文信息