摘要
验证器虽能通过测试时缩放增强大语言模型推理,但在复杂领域面临挑战:中间推理错误导致误判,且缺乏外部依据使其在计算或知识密集型任务中不可靠。为此,本文提出“代理验证器”框架,将奖励建模转化为多轮次、工具增强的审议过程。该框架引入互补的前向与后向智能体,分别追踪从前提到结论的推导及反向核查。结合强化学习(AgentV-RL),验证器能自主交织工具使用与内部推理。实验表明,该方法在并行和顺序测试时缩放下均取得一致性能提升,其 4B 版本超越最先进结果 25.2%。
AI 推荐理由
论文核心提出代理验证器框架,通过双向推理和工具增强显著提升 LLM 推理可靠性。
研究机构
College of Computer Science and Artificial Intelligence, Fudan University
Huazhong University of Science and Technology
The University of Hong Kong
ByteDance Seed
Institute of Trustworthy Embedded AI, Fudan University
论文信息