Chain-of-Thought Faithfulness Evaluation Bias LLM Reasoning
摘要

本文指出思维链(CoT)忠实度评估中存在系统性格式混淆:在含显式结尾答案的标准基准中,腐化研究检测的是答案文本位置而非计算发生处。实验表明,移除答案陈述可使后缀敏感度显著下降;冲突答案实验量化了该因果机制,显示模型倾向于遵循显式答案文本而非早期推理。生成探测证实答案非早期确定,但消费时系统性地受格式主导。作者提出包含问题控制、格式表征及全位置扫描的三前提协议,作为此类研究的最低标准。

AI 推荐理由

论文深入剖析思维链(CoT)的忠实度评估机制,揭示格式混淆对推理归因的根本性影响。

研究机构
Independent Researcher
论文信息
作者 Gabriel Garcia
发布日期 2026-05-11
arXiv ID 2605.10799
相关性评分 9/10 (高度相关)