Tool Use Reinforcement Learning API Orchestration Data Synthesis
摘要

多步工具编排要求大语言模型按正确顺序调用多个依赖 API 并传递中间输出,极具挑战性。现有模型常因参数错误导致执行失败,且面临环境简单化与二元奖励缺乏部分正确性信号两大障碍。本文提出新框架:首先构建基于真实 API 响应缓存的强化学习环境,实现可控复杂度的高效数据合成;其次设计分级奖励机制,将正确性分解为原子有效性(不同粒度下的单次调用正确性)与编排正确性(遵循依赖的工具序列)。在 ComplexFuncBench 上的实验表明,该方法显著提升了轮次准确率,消融研究证实两个奖励组件均不可或缺。

AI 推荐理由

论文核心研究多步工具编排、API 调用准确性及奖励机制,直接针对技能学习。

研究机构
Stores Foundational AI, Amazon Inc., Palo Alto, CA, USA
论文信息
作者 Cheng Jiayang, Xin Liu, Zhihan Zhang, Haoyang Wen, Zixuan Zhang et al.
发布日期 2026-03-25
arXiv ID 2603.24709
相关性评分 9/10 (高度相关)