摘要
大型语言模型编码代理通常通过重复读取文件和 grep 搜索来探索代码库,每次查询消耗大量令牌且缺乏结构理解。本文提出 Codebase-Memory,一个开源系统,利用模型上下文协议(MCP)构建基于 Tree-Sitter 的持久化知识图谱。该系统通过多阶段流水线解析 66 种语言,包含并行工作池、调用图遍历、影响分析及社区发现。在 31 个真实仓库的评估中,该系统以十分之一的令牌消耗和减半的工具调用次数,达到了 83% 的回答质量。
AI 推荐理由
论文提出基于知识图谱的持久化记忆系统,核心解决代码库结构化记忆与高效检索问题。
研究机构
Independent Researcher, Berlin, Germany
Institute of Medical Informatics, Charité – Universitätsmedizin Berlin, Berlin, Germany
Clinical Study Center, Berlin Institute of Health, Berlin, Germany
Institute of Informatics, Humboldt University, Berlin, Germany
Institute of Informatics, Freie Universität Berlin, Berlin, Germany
Health Data Science Unit, University Hospital Heidelberg, Heidelberg, Germany
论文信息