Chain-of-Thought Faithfulness Evaluation LLM Judges Benchmark
摘要

大语言模型日益被用作思维链推理的评判者,但其能否可靠评估过程忠实度而非仅答案合理性尚不明确。本文提出 C2-Faith 基准,基于 PRM800K 构建,聚焦忠实度的两个互补维度:因果性(每步是否逻辑连贯)与覆盖度(关键中间推断是否存在)。通过受控扰动生成含已知因果错误位置及不同删除率的样本,评估三种前沿模型在二元因果检测、因果步骤定位及覆盖度评分任务上的表现。结果表明模型排名高度依赖任务设定,且所有模型在错误检测与定位间存在显著差距,覆盖度判断常系统性高估。

AI 推荐理由

论文核心研究思维链推理的因果性与覆盖度忠实度评估,直接针对推理过程质量。

研究机构
微软
论文信息
作者 Avni Mittal, Rauno Arike
发布日期 2026-03-05
arXiv ID 2603.05167
相关性评分 9/10 (高度相关)