Code Generation API Usage Data Synthesis Private Libraries
摘要

大语言模型在通用代码生成上表现优异,但在涉及私有库 API 调用时仍显不足。现有检索增强方法即便提供准确文档,模型也难以有效调用。为此,本文提出 PriCoder 方法,通过自动合成数据教导 LLM 掌握私有库 API 调用技能。该方法将数据合成建模为图构建过程,交替执行“渐进式图演化”以提升样本多样性,以及“多维图剪枝”以严格过滤保证数据质量。基于新构建的基准测试实验表明,PriCoder 显著提升了私有库导向的代码生成性能,pass@1 指标提升超 20%,且未损害通用代码生成能力。

AI 推荐理由

论文核心在于教授 LLM 调用私有库 API 的技能,通过合成数据提升工具使用能力。

研究机构
北京航空航天大学人工智能学院 美国加州州立大学普拉瑟尔分校 南京大学计算机学院 中国科学院软件研究所 南京大学软件学院 南京大学 Princeton Inc. 北京理工大学计算机学院 北京理工大学 北京理工大学信息与电子工程学院
论文信息
作者 Yitong Zhang, Chengze Li, Ruize Chen, Guowei Yang, Xiaoran Jia et al.
发布日期 2026-03-16
arXiv ID 2603.15159
相关性评分 9/10 (高度相关)