Agent Memory Evidence Construction Benchmark RAG
摘要

现有证据构建系统(如分块检索、代理记忆、知识图谱遍历等)因基准测试不统一而难以跨范式诊断。本文提出 AuthTrace,首个利用单作者语料库双重特性的诊断基准,将主要范式置于同一语料和查询集上评估。该基准基于主题密集的语料库,提供 2099 个含详尽黄金证据的实例。实验发现:证据召回率而非精确率是答案质量的主导预测因子;扇入梯度揭示了特定范式的崩溃模式;全上下文提示普遍失效,证明证据构建是超越原始语料暴露的必要能力。

AI 推荐理由

论文核心评估代理记忆架构与证据构建机制,直接针对记忆检索效能。

研究机构
WeChat, Tencent Inc., Beijing, China
论文信息
作者 Xiaoqing Wu, Feifei Li, Haoliang Ming, Wenhui Que
发布日期 2026-05-25
arXiv ID 2605.25382
相关性评分 9/10 (高度相关)