摘要
尽管大语言模型具备强大的推理能力,但其内部知识限制了复杂任务的表现。利用外部工具是有效途径,但现有方法依赖昂贵的监督微调(SFT)。本文提出上下文强化学习(ICRL),一种仅需强化学习的框架,通过在 rollout 阶段利用少样本提示引入上下文示例,教导模型调用工具,并随训练逐步减少示例至零-shot 设置。实验表明,ICRL 在多个基准上达到最先进水平,是传统 SFT 流程的可扩展、数据高效替代方案。
AI 推荐理由
论文核心提出 ICRL 框架,专门解决 LLM 无需 SFT 即可学习调用外部工具的问题,直接针对技能学习。
研究机构
National University of Singapore
论文信息