Tool Learning Hierarchical RL LLM Agents RLVR
摘要

工具学习使大语言模型能够调用外部工具完成任务。现有研究通常采用分层结构,由高层策略负责全局规划与任务分解,低层策略专注工具调用。然而,这些工作往往分别优化两层策略,导致规划器与执行器不对齐,限制了模型性能。本文提出能力对齐分层学习(CAHL)方法,利用强化学习与验证反馈(RLVR)联合优化高低层策略,实现更好的规划 - 执行对齐。在受限工具基准及开放环境中的实验证实了该方法的有效性。

AI 推荐理由

论文核心解决工具学习中规划与执行的对齐问题,直接提升 Agent 工具调用技能。

研究机构
Jilin University
论文信息
作者 Haotong Yang, Ting Long, Yi Chang
发布日期 2026-06-08
arXiv ID 2606.09371
相关性评分 9/10 (高度相关)