Tool Use Reinforcement Learning Credit Assignment LLM Agent
摘要

人类知晓何时寻求帮助,而大语言模型往往缺乏这种能力。现有提示工程无法教会模型识别自身知识边界,轨迹级强化学习亦难以隔离具体工具调用的贡献。本文提出 CARL(能力感知强化学习),通过在自然工具使用边界分解 rollout,从单一二元结果中为每个片段分配独立信用,无需外部评判。实验表明,该方法能精准区分参数可解与需工具辅助的问题,显著减少不必要的工具调用,并在多个基准测试中大幅提升小模型的准确率。

AI 推荐理由

论文核心研究 LLM 何时调用工具的技能,提出细粒度信用分配机制优化决策。

研究机构
Microsoft AI
论文信息
作者 Abhijit Kumar, Zoey Wu, Mohit Suley
发布日期 2026-05-27
arXiv ID 2605.27788
相关性评分 9/10 (高度相关)