Apple · ML Research

学习扩散语言模型的去掩码策略

Learning Unmasking Policies for Diffusion Language Models

二〇二六年七月三日 · 英文原文

扩散语言模型(dLLM)在多项任务上达到与自回归模型相当的下游性能,同时具备更高推理效率潜力。其采样过程决定每步取消掩码的token,近期研究显示,置信度阈值等启发式策略相比随机取消掩码可提升样本质量与token吞吐量,但需手动调参且存在性能缺陷。

扩散(大型)语言模型(dLLM)如今在许多任务上已达到与自回归模型相当的下游性能,同时有望在推理过程中实现更高效率。dLLM 的一个关键设计环节是采样过程,该过程决定在每个扩散步骤中应取消掩码哪些 token。事实上,近期研究发现,与随机取消掩码相比,置信度阈值等启发式策略既能提升样本质量,也能提高 token 吞吐量。然而,这类启发式方法存在缺陷:它们需要手动调参,并且我们观察到其性能……

译自 Apple · ML Research · 录于 二〇二六年七月三日