摘要
大型语言模型在成本与延迟敏感场景中部署日益广泛。虽然思维链提升了推理能力,但在简单请求上易浪费令牌。本文研究工具使用型 LLM 的选择性思维,提出自适应拒绝采样(Ada-RS),这是一种算法无关的样本过滤框架,旨在学习选择性且高效的推理。该方法对多个采样完成项进行自适应长度惩罚奖励评分,并应用随机拒绝采样仅保留高奖励候选者用于下游优化。实验表明,Ada-RS 可显著减少输出令牌与思考率,同时保持或提升工具调用准确率。
AI 推荐理由
论文核心研究选择性思维与高效推理机制,通过自适应采样优化推理效率。
研究机构
PayPal AI
论文信息