摘要
针对代码生成大模型需使用预训练数据中缺失 API 的挑战,本文提出 NovelAPIBench,一个全自动动态基准。该基准能发现新 API、提取分解知识包、生成可执行任务并将失败样本归类。实验对比了检索注入与参数自适应两种知识获取方式,发现两者角色互补:检索提供易变的 API 内容,而微调提升过程整合能力。研究还指出,单纯增加上下文(如源代码)可能因导入路径错误而降低性能,且微调主要教会模型如何利用提供的知识包。
AI 推荐理由
论文核心研究 LLM 如何获取和使用新 API,涉及工具调用、技能习得及知识注入机制。
研究机构
NYU Shanghai
论文信息