摘要
工具使用扩展了大语言模型的能力,但可靠执行需平衡推理深度与结构有效性。本文提出 CAST,一种基于案例的框架,将历史执行轨迹视为结构化案例。CAST 提取案例信号以识别复杂度 profile 来估计最佳推理策略,并利用失败 profile 映射潜在的结构崩溃。该框架将此知识转化为细粒度奖励设计与自适应推理,使模型在强化学习中自主内化基于案例的策略。实验表明,CAST 显著提升了执行准确率并减少了不必要的推理长度。
AI 推荐理由
论文核心研究 LLM 工具使用的可靠性与执行策略,直接对应技能学习中的工具调用与优化。
研究机构
电子科技大学, 成都 611731, 中国
论文信息