摘要
多步工具编排要求大语言模型按正确顺序调用多个依赖 API 并传递中间输出,极具挑战性。现有模型常因参数错误导致执行失败,且面临环境简单化与二元奖励缺乏部分正确性信号两大障碍。本文提出新框架:首先构建基于真实 API 响应缓存的强化学习环境,实现可控复杂度的高效数据合成;其次设计分级奖励机制,将正确性分解为原子有效性(不同粒度下的单次调用正确性)与编排正确性(遵循依赖的工具序列)。在 ComplexFuncBench 上的实验表明,该方法显著提升了轮次准确率,消融研究证实两个奖励组件均不可或缺。
AI 推荐理由
论文核心研究多步工具编排、API 调用准确性及奖励机制,直接针对技能学习。
研究机构
Stores Foundational AI, Amazon Inc., Palo Alto, CA, USA
论文信息