摘要
可靠的置信度估计是通过纯文本 API 安全部署思维链(CoT)推理的关键。针对现有黑盒基线自一致性方法成本高且忽略轨迹几何特性的问题,本文提出一种黑盒轨迹置信度评分方法。该方法将 CoT 嵌入为滑动窗口轨迹,并通过单参数 softmax 测量其向外部答案锚点的收敛性,无需 logits 或隐藏状态。在多个基准测试中,融合该评分与覆盖及言语化通道,显著优于传统自一致性方法。研究进一步揭示了推理轨迹中几何特征的分布规律,并验证了不同信号通道的独立性与互补性。
AI 推荐理由
论文核心研究思维链(CoT)推理轨迹的几何特性与置信度评估,直接针对推理机制。
研究机构
Novo Nordisk
University of Oxford
论文信息