摘要
大语言模型在生成逐步解决方案时表现优异,但诊断多步推理轨迹中的失败点仍具挑战。现有置信度估计方法仅限于最终答案或需访问模型内部。本文提出逐步置信度归因(SCA)框架,仅利用生成的推理轨迹为黑盒模型分配步骤级置信度。该方法应用信息瓶颈原则:与正确解共识结构一致的步骤获高置信度,偏差则被标记为潜在错误。实验表明,SCA 能可靠识别与推理错误强相关的低置信度步骤,并指导自我修正,将修正成功率提升高达 13.5%。
AI 推荐理由
论文核心聚焦多步推理失败诊断,提出基于置信度的归因框架以提升推理准确性。
研究机构
School of Computing and Augmented Intelligence, Arizona State University
论文信息