Tool Use Adaptive Reasoning Reinforcement Learning Case-Based Reasoning
摘要

工具使用扩展了大语言模型的能力,但可靠执行需平衡推理深度与结构有效性。本文提出 CAST,一种基于案例的框架,将历史执行轨迹视为结构化案例。CAST 提取案例信号以识别复杂度 profile 来估计最佳推理策略,并利用失败 profile 映射潜在的结构崩溃。该框架将此知识转化为细粒度奖励设计与自适应推理,使模型在强化学习中自主内化基于案例的策略。实验表明,CAST 显著提升了执行准确率并减少了不必要的推理长度。

AI 推荐理由

论文核心研究 LLM 工具使用的可靠性与执行策略,直接对应技能学习中的工具调用与优化。

研究机构
电子科技大学, 成都 611731, 中国
论文信息
作者 Renning Pang, Tian Lan, Leyuan Liu, Piao Tong, Sheng Cao et al.
发布日期 2026-05-14
arXiv ID 2605.15041
相关性评分 9/10 (高度相关)