tool use continual learning trajectory supervision API calling
摘要

大多数语言模型训练数据仅展示最终产物而非生成过程。本研究在工具使用场景中探讨:当模型学习一系列新 API 领域时,保留工具使用轨迹是否优于移除中间 API 记录?研究基于 API-Bank 数据集,对 Llama 3.1 8B Instruct 模型进行 QLoRA 微调,分为四个顺序领域块。实验对比了移除历史请求/响应(条件 A)与保留轨迹上下文(条件 B)的效果。结果显示,条件 B 的最终全调用准确率达 56.9%,显著高于条件 A 的 39.2%,且 API 名称准确率提升 7.7 个百分点,尽管训练 token 消耗增加 25.1%。

AI 推荐理由

论文核心研究工具使用学习中的轨迹监督机制,直接提升 API 调用技能。

研究机构
UMass Amherst
论文信息
作者 Vishnu Vardhan Reddy, Sagnik Chatterjee, Soumik Bhatta
发布日期 2026-05-10
arXiv ID 2605.09734
相关性评分 9/10 (高度相关)