Benchmark Conversational Memory Long-Context RAG
摘要

本文提出 MemoryDocDataSet,这是一个合成基准,旨在同时评估多轮对话历史导航与长文档深度阅读理解能力。该数据集包含 50 个微世界及 1000 个问答对,其核心特征是“混合源”问题,要求系统先检索对话历史以定位相关文档,再从长文中提取答案。实验表明,现有基线模型在处理此类联合检索任务时表现显著下降,揭示了当前架构在统一对话记忆与长文档导航方面的不足,为未来研究提供了重要方向。

AI 推荐理由

论文核心在于评估对话记忆与长文档推理的联合机制,直接针对记忆架构缺陷。

研究机构
东北大学 约翰霍普金斯大学 哥伦比亚大学 独立研究员
论文信息
作者 Qiyang Xie, Jialun Wu, Xinjie He, Su Liu, Shuai Xiao et al.
发布日期 2026-06-03
arXiv ID 2606.04442
相关性评分 9/10 (高度相关)