Uncertainty Estimation Chain-of-Thought Self-Consistency Reasoning Models
摘要

不确定性估计对部署推理语言模型至关重要,但在扩展的思维链推理下仍知之甚少。本研究将并行采样作为一种完全黑盒方法,利用口头表达的置信度和自一致性进行分析。在涵盖数学、STEM 和人文学科的三个推理模型及十七项任务中,我们刻画了这些信号的缩放规律。研究发现,虽然两者均随采样扩展,但自一致性的初始区分度较低。主要增益源于信号组合:仅用两个样本的混合估计器即可显著提升性能,且优于单一信号的大规模采样效果,尤其在数学领域表现更佳。

AI 推荐理由

论文核心研究推理模型中的不确定性估计与思维链扩展的关系,属于推理能力的关键机制。

研究机构
图尔大学计算机科学学院
论文信息
作者 Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya et al.
发布日期 2026-03-19
arXiv ID 2603.19118
相关性评分 9/10 (高度相关)