Self-Verification Test-Time Compute Agentic Search Reasoning
摘要

代理搜索要求语言模型探索多源信息以回答复杂问题。扩展测试时计算是提升性能的有效途径,但现有方法因正确答案稀疏及依赖模型校准而受限。本文提出 FineVerify,一种细粒度自验证框架,将问题分解为可检查的子问题,针对每个子问题验证采样候选答案,并选择聚合得分最高者。该方法将选择转化为简单的局部判断,并在统一标准下生成评分。在四个基准测试中,FineVerify 显著优于标准扩展基线,仅需四个采样轨迹即可大幅提升准确率,且生成可解释的验证轨迹以辅助系统审计。

AI 推荐理由

提出细粒度自验证框架,通过分解子问题提升推理准确性,核心聚焦推理机制。

研究机构
新加坡国立大学
论文信息
作者 James Xu Zhao, Hui Chen, Bryan Hooi, See-Kiong Ng
发布日期 2026-05-30
arXiv ID 2606.00660
相关性评分 9/10 (高度相关)