摘要
随着基于代理方法的快速发展,代理检索增强生成(Agentic RAG)已成为重要研究方向。多跳推理要求模型进行深思熟虑的思考和多步交互,是评估此类能力的关键测试场。然而,现有基准通常仅提供最终问答,缺乏连接原子问题与最终多跳查询的中间跳跃级问题,限制了细粒度评估。为此,本文提出 AgenticRAGTracer,这是首个主要由大语言模型自动构建且支持逐步验证的 Agentic RAG 基准。实验表明,即使是最先进的模型在该数据集上表现不佳,主要失败原因在于推理链扭曲,凸显了模型在根据任务逻辑结构分配步骤方面的关键缺陷。
AI 推荐理由
论文核心聚焦多跳推理诊断,分析推理链断裂与过度延伸问题,属推理能力核心研究。
研究机构
北京科技大学
北京大学
北京智源研究院
论文信息