摘要
现有证据构建系统(如分块检索、代理记忆、知识图谱遍历等)因基准测试不统一而难以跨范式诊断。本文提出 AuthTrace,首个利用单作者语料库双重特性的诊断基准,将主要范式置于同一语料和查询集上评估。该基准基于主题密集的语料库,提供 2099 个含详尽黄金证据的实例。实验发现:证据召回率而非精确率是答案质量的主导预测因子;扇入梯度揭示了特定范式的崩溃模式;全上下文提示普遍失效,证明证据构建是超越原始语料暴露的必要能力。
AI 推荐理由
论文核心评估代理记忆架构与证据构建机制,直接针对记忆检索效能。
研究机构
WeChat, Tencent Inc., Beijing, China
论文信息