Tool Use Reinforcement Learning In-Context Learning Data Efficiency
摘要

尽管大语言模型具备强大的推理能力,但其内部知识限制了复杂任务的表现。利用外部工具是有效途径,但现有方法依赖昂贵的监督微调(SFT)。本文提出上下文强化学习(ICRL),一种仅需强化学习的框架,通过在 rollout 阶段利用少样本提示引入上下文示例,教导模型调用工具,并随训练逐步减少示例至零-shot 设置。实验表明,ICRL 在多个基准上达到最先进水平,是传统 SFT 流程的可扩展、数据高效替代方案。

AI 推荐理由

论文核心提出 ICRL 框架,专门解决 LLM 无需 SFT 即可学习调用外部工具的问题,直接针对技能学习。

研究机构
National University of Singapore
论文信息
作者 Yaoqi Ye, Yiran Zhao, Keyu Duan, Zeyu Zheng, Kenji Kawaguchi et al.
发布日期 2026-03-09
arXiv ID 2603.08068
相关性评分 9/10 (高度相关)