摘要
代理搜索要求语言模型探索多源信息以回答复杂问题。扩展测试时计算是提升性能的有效途径,但现有方法因正确答案稀疏及依赖模型校准而受限。本文提出 FineVerify,一种细粒度自验证框架,将问题分解为可检查的子问题,针对每个子问题验证采样候选答案,并选择聚合得分最高者。该方法将选择转化为简单的局部判断,并在统一标准下生成评分。在四个基准测试中,FineVerify 显著优于标准扩展基线,仅需四个采样轨迹即可大幅提升准确率,且生成可解释的验证轨迹以辅助系统审计。
AI 推荐理由
提出细粒度自验证框架,通过分解子问题提升推理准确性,核心聚焦推理机制。
研究机构
新加坡国立大学
论文信息