Bayesian Belief Tracking Reasoning Reliability Calibration LLM Evaluation
摘要

本文研究了在最终答案未知前对长推理轨迹进行可靠性估计的问题,提出利用前缀安全观测进行条件成功概率估算。通过序列贝叶斯信念追踪(SBBT)校准观测似然并递归更新双状态信念,该框架统一处理标量分数、文本及自验证标记等多种证据。实验表明,仅基于分数的 SBBT 能优化概率校准(Brier 分数),而提升排序能力(AUROC)则需依赖结构感知证据。研究揭示了标量分数主要支持概率质量,而结构感知信号在强基线未吸收证据时才显著改善排序的理论机制。

AI 推荐理由

论文核心研究 LLM 推理过程中的可靠性估计与信念追踪机制,直接提升推理质量。

研究机构
Cornell University Columbia University
论文信息
作者 Zhenghan Song, Yunyi Li, Yulong Liu
发布日期 2026-05-26
arXiv ID 2605.27712
相关性评分 9/10 (高度相关)