摘要
检查思维链(CoT)推理是理解大语言模型输出原因的常用手段,但 CoT 忠实性问题严重限制了其洞察力。本文提出反事实模拟训练(CST)方法,通过奖励那些能使模拟器在反事实输入上准确预测模型输出的 CoT,来提升其忠实性。实验表明,CST 显著提高了基于线索的反事实监控准确率及通用反事实的可模拟性,优于提示基线,且大模型从中获益更多。
AI 推荐理由
论文核心研究思维链(CoT)的忠实性,提出新训练方法直接优化推理过程的可解释性与准确性。
研究机构
斯坦福大学
论文信息