摘要
扩散大语言模型(dLLMs)理论上支持任意顺序的令牌解码,有望比自回归模型提供更丰富的推理路径探索。然而实践中,随机解码往往损害生成质量。低置信度重掩码虽能提升单样本质量,却抑制了探索并限制了多样本增益,形成了根本性的质量 - 探索困境。本文统一解释了该困境,证明低置信度重掩码在优化短视质量代理的同时限制了序列分布熵。为此,我们刻画了平衡质量与探索的最优分布,并开发了一种独立的 Metropolis-Hastings 采样器以在解码中近似目标分布。实验表明,该方法在多个推理基准上实现了更优的权衡。
AI 推荐理由
论文核心解决扩散语言模型在推理任务中的质量与探索权衡问题,直接提升推理能力。
研究机构
University of Illinois Chicago
Tsinghua University
McGill University
论文信息