Uncertainty Quantification Reasoning Traces LLM Reliability
摘要

针对推理语言模型不确定性估计难以部署的问题,本文提出 SELFDOUBT 框架。该方法无需多次采样或访问模型内部参数,仅通过单次推理轨迹即可提取行为信号。核心指标“对冲与验证比率”(HVR)能检测推理过程中的不确定性标记及自我检查行为。实验表明,无对冲标记的轨迹准确率高达 96%,且该方法在显著降低推理成本的同时,性能优于基于采样的语义熵方法,为专有推理模型提供了可扩展的不确定性估计方案。

AI 推荐理由

论文核心研究推理模型的不确定性量化,直接分析推理轨迹中的行为信号以评估推理质量。

研究机构
Independent Researcher Zillow Group
论文信息
作者 Satwik Pandey, Suresh Raghu, Shashwat Pandey
发布日期 2026-04-07
arXiv ID 2604.06389
相关性评分 9/10 (高度相关)