摘要
工具学习使大语言模型能够调用外部工具完成任务。现有研究通常采用分层结构,由高层策略负责全局规划与任务分解,低层策略专注工具调用。然而,这些工作往往分别优化两层策略,导致规划器与执行器不对齐,限制了模型性能。本文提出能力对齐分层学习(CAHL)方法,利用强化学习与验证反馈(RLVR)联合优化高低层策略,实现更好的规划 - 执行对齐。在受限工具基准及开放环境中的实验证实了该方法的有效性。
AI 推荐理由
论文核心解决工具学习中规划与执行的对齐问题,直接提升 Agent 工具调用技能。
研究机构
Jilin University
论文信息