摘要
本文指出,当前关于思维链(CoT)忠实度的研究常报告单一聚合数值,暗示其为客观属性,实则不然。通过对 12 个开源模型产生的 10,276 条推理轨迹应用三种不同分类器,研究发现分类器选择会导致忠实度率显著差异(69.7%-82.6%),甚至逆转模型排名。根本原因在于不同分类器对“忠实度”的操作化定义严格程度不同。结果表明,跨研究的忠实度数据不可直接比较,未来评估应报告多方法论下的敏感性范围而非单点估计。
AI 推荐理由
论文核心研究思维链(CoT)的忠实度评估,直接关联推理能力的可靠性与测量方法。
研究机构
内华达大学拉斯维加斯分校管理学院,创业与技术系,美国拉斯维加斯
DeepNeuro AI,美国拉斯维加斯
论文信息