Diffusion LLM Reasoning Sampling Strategy Exploration-Exploitation
摘要

扩散大语言模型(dLLMs)理论上支持任意顺序的令牌解码,有望比自回归模型提供更丰富的推理路径探索。然而实践中,随机解码往往损害生成质量。低置信度重掩码虽能提升单样本质量,却抑制了探索并限制了多样本增益,形成了根本性的质量 - 探索困境。本文统一解释了该困境,证明低置信度重掩码在优化短视质量代理的同时限制了序列分布熵。为此,我们刻画了平衡质量与探索的最优分布,并开发了一种独立的 Metropolis-Hastings 采样器以在解码中近似目标分布。实验表明,该方法在多个推理基准上实现了更优的权衡。

AI 推荐理由

论文核心解决扩散语言模型在推理任务中的质量与探索权衡问题,直接提升推理能力。

研究机构
University of Illinois Chicago Tsinghua University McGill University
论文信息
作者 Liancheng Fang, Aiwei Liu, Henry Peng Zou, Yankai Chen, Enze Ma et al.
发布日期 2026-04-01
arXiv ID 2604.00375
相关性评分 9/10 (高度相关)