摘要
思维链(CoT)推理提升了大语言模型准确率,但低成本检测失败仍具挑战。本研究探讨推理步骤间的不确定性动态形状(通过每步采样少量答案完成度捕获)是否能预测正确性。我们提出“熵轨迹单调性”概念:若每步答案分布熵持续下降,则链为单调。实验显示,单调链准确率显著高于非单调链,且总熵减无预测力,表明形状优于幅度。该方法在校准和覆盖面上优于标量基线,成本仅为自一致性方法的八分之一,并在不同模型上复现了结果。
AI 推荐理由
论文核心研究思维链推理中的不确定性动态与可靠性预测,直接提升推理能力。
研究机构
华北理工大学
论文信息