摘要
人类知晓何时寻求帮助,而大语言模型往往缺乏这种能力。现有提示工程无法教会模型识别自身知识边界,轨迹级强化学习亦难以隔离具体工具调用的贡献。本文提出 CARL(能力感知强化学习),通过在自然工具使用边界分解 rollout,从单一二元结果中为每个片段分配独立信用,无需外部评判。实验表明,该方法能精准区分参数可解与需工具辅助的问题,显著减少不必要的工具调用,并在多个基准测试中大幅提升小模型的准确率。
AI 推荐理由
论文核心研究 LLM 何时调用工具的技能,提出细粒度信用分配机制优化决策。
研究机构
Microsoft AI
论文信息