摘要
聚合并剪枝多个样本的推理时方法已成为引导大语言模型的强大范式,但缺乏对其精度 - 成本权衡的原则性理解。本文引入粒子滤波算法(如序列蒙特卡洛 SMC)视角来严谨研究此类方法。给定基础语言模型和估计预期终端奖励的过程奖励模型,我们探讨了在给定过程奖励评估次数下,从目标分布采样的准确度。理论上,我们确定了使 SMC 具有非渐近保证的标准、算法改进以及所有粒子滤波方法面临的基本极限。实证表明,理论标准有效控制了 SMC 的采样误差,但不一定决定其最终精度。
AI 推荐理由
论文核心研究推理时的采样与剪枝机制,利用粒子滤波理论提升模型推理准确性。
研究机构
Microsoft Research
MIT
NYU
论文信息