摘要
思维链(CoT)已成为解释和审计大语言模型行为的核心手段,但证据表明其往往无法忠实反映模型背后的计算过程。现有忠实度指标缺乏真实标签验证,多依赖正交属性如合理性。本文构建了一种任务,其输出可揭示必需的中间计算步骤,并开发了自动化标注流程以生成步骤级和 CoT 级的真实忠实度标签。基于此,我们提出了 BonaFide 基准,涵盖 13 项任务和 10 个模型的 3066 个标注 CoT。评估显示,大多数指标表现接近随机,存在强烈预测偏差且在长 CoT 上退化,最佳指标 AUROC 仅为 0.70,且计算成本高昂。结果揭示了当前评估的根本缺陷。
AI 推荐理由
论文核心评估思维链(CoT)的忠实度,直接关乎推理过程的可解释性与可靠性。
研究机构
特拉维夫大学
犹他大学
论文信息