摘要
从序列级幂分布采样可激发基座语言模型的强化学习级推理能力,但标准 Metropolis-Hastings 采样器计算昂贵且混合缓慢。本文指出其结构性失配问题:高熵决策点稀疏且聚集,而均匀提议导致计算浪费。为此,我们提出熵引导幂采样(EGPS),一种无需训练和验证器的采样器,利用前向传播中的 token 级熵重推导提议分布。EGPS 跳过确定性块,将 MCMC 移动局部化至高熵邻域,并在决策点应用多试 Metropolis 算法,使采样成本与熵质量而非序列长度成正比。实验表明,该方法在多个基准测试中达到最优精度,并显著加速。
AI 推荐理由
论文核心提出熵引导采样方法,旨在无需训练即可显著提升基座模型的推理能力。
研究机构
Hasso Plattner Institut
GreenBit.AI
German University of Digital Science
论文信息