摘要
大多数语言模型训练数据仅展示最终产物而非生成过程。本研究在工具使用场景中探讨:当模型学习一系列新 API 领域时,保留工具使用轨迹是否优于移除中间 API 记录?研究基于 API-Bank 数据集,对 Llama 3.1 8B Instruct 模型进行 QLoRA 微调,分为四个顺序领域块。实验对比了移除历史请求/响应(条件 A)与保留轨迹上下文(条件 B)的效果。结果显示,条件 B 的最终全调用准确率达 56.9%,显著高于条件 A 的 39.2%,且 API 名称准确率提升 7.7 个百分点,尽管训练 token 消耗增加 25.1%。
AI 推荐理由
论文核心研究工具使用学习中的轨迹监督机制,直接提升 API 调用技能。
研究机构
UMass Amherst
论文信息