step-wise verification hidden-state steering LLM reasoning verifier calibration
摘要

生成式验证器在逐步验证中表现良好,但其行为往往校准不佳,表现为过于宽容或苛刻。本文研究了是否可通过隐藏状态干预来控制这种“验证器严格度”。研究发现,验证器接受或拒绝步骤的倾向编码在验证段落边界附近的隐藏状态中。基于此,作者提出 VerifySteer 方法,利用潜在正确性信号进行样本级路由,并选择性干预段落边界。实验表明,该方法在减少计算量的同时,性能优于提示优化和激活引导基线,并与自一致性方法相当。

AI 推荐理由

论文核心研究通过控制验证器严格度来提升逐步推理验证的准确性,直接优化推理过程。

研究机构
Dartmouth College
论文信息
作者 Yefan Zhou, Yilun Zhou, Austin Xu, Soroush Vosoughi, Shafiq Joty et al.
发布日期 2026-05-20
arXiv ID 2605.20745
相关性评分 9/10 (高度相关)