超越下一个词元预测:扩散式与自回归语言模型的性能对比分析
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
摘要
大型语言模型(LLM)在文档处理、代码生成等NLP任务上达到最先进性能。自回归语言模型(ARM)作为主导范式,依次生成基于先前token的token,虽精度高,但因顺序依赖导致算术强度低。扩散语言模型(DLM)近期作为替代方案出现,其生成机制与ARM不同。
大型语言模型(LLM)在包括文档处理和代码生成在内的广泛自然语言处理(NLP)任务上已达到最先进的性能。自回归语言模型(ARM)作为LLM的主导范式,通过依次生成基于所有先前token的token。尽管这些模型在多种下游任务中实现了高精度,但由于下一个token预测中固有的顺序依赖性,它们的算术强度较低。近期,扩散语言模型(DLM)作为一种有前景的替代方案崭露头角……
译自 Apple · ML Research · 录于 二〇二六年八月八日