Agentic RAG Multi-hop Reasoning Benchmark Diagnosis
摘要

随着基于代理方法的快速发展,代理检索增强生成(Agentic RAG)已成为重要研究方向。多跳推理要求模型进行深思熟虑的思考和多步交互,是评估此类能力的关键测试场。然而,现有基准通常仅提供最终问答,缺乏连接原子问题与最终多跳查询的中间跳跃级问题,限制了细粒度评估。为此,本文提出 AgenticRAGTracer,这是首个主要由大语言模型自动构建且支持逐步验证的 Agentic RAG 基准。实验表明,即使是最先进的模型在该数据集上表现不佳,主要失败原因在于推理链扭曲,凸显了模型在根据任务逻辑结构分配步骤方面的关键缺陷。

AI 推荐理由

论文核心聚焦多跳推理诊断,分析推理链断裂与过度延伸问题,属推理能力核心研究。

研究机构
北京科技大学 北京大学 北京智源研究院
论文信息
作者 Qijie You, Wenkai Yu, Wentao Zhang
发布日期 2026-02-22
arXiv ID 2602.19127
相关性评分 9/10 (高度相关)