摘要
大语言模型在通用代码生成上表现优异,但在涉及私有库 API 调用时仍显不足。现有检索增强方法即便提供准确文档,模型也难以有效调用。为此,本文提出 PriCoder 方法,通过自动合成数据教导 LLM 掌握私有库 API 调用技能。该方法将数据合成建模为图构建过程,交替执行“渐进式图演化”以提升样本多样性,以及“多维图剪枝”以严格过滤保证数据质量。基于新构建的基准测试实验表明,PriCoder 显著提升了私有库导向的代码生成性能,pass@1 指标提升超 20%,且未损害通用代码生成能力。
AI 推荐理由
论文核心在于教授 LLM 调用私有库 API 的技能,通过合成数据提升工具使用能力。
研究机构
北京航空航天大学人工智能学院
美国加州州立大学普拉瑟尔分校
南京大学计算机学院
中国科学院软件研究所
南京大学软件学院
南京大学
Princeton Inc.
北京理工大学计算机学院
北京理工大学
北京理工大学信息与电子工程学院
论文信息