残差上下文扩散语言模型
Residual Context Diffusion Language Models
摘要
残差上下文扩散(Residual Context Diffusion, RCD)被提出作为扩散大语言模型(dLLMs)的改进模块。现有逐块dLLMs依赖“重新掩码”机制,仅解码最置信token并丢弃其余部分,浪费计算资源。RCD回收被丢弃token的上下文信息,用于后续解码迭代,提升计算效率。该方法由研究团队提出,旨在优化并行解码过程。
扩散大语言模型(Diffusion Large Language Models, dLLMs)已成为纯自回归语言模型的一种有前景的替代方案,因为它们能够并行解码多个 token。然而,最先进的逐块 dLLMs 依赖于一种“重新掩码”(remasking)机制,该机制仅解码最置信的 token 并丢弃其余部分,实际上浪费了计算资源。我们证明,回收被丢弃 token 的计算是有益的,因为这些 token 保留了有助于后续解码迭代的上下文信息。基于此,我们提出残差上下文扩散(Residual Context Diffusion, RCD),这是一个模块……
译自 Apple · ML Research · 录于 二〇二六年七月三日