AURORA-LM:连续潜空间扩散语言建模的自编码统一表示
AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
来自 Nanjing University
摘要
语言在生成建模中仍是一个异类:图像、视频和音频日益在连续潜空间中建模,而文本生成仍主要依赖离散词元。现有的连续语言模型要么继承了并非为联合生成和解码设计的嵌入空间,要么压缩自编码潜变量以简化扩散过程,从而牺牲了词元级保真度。我们没有为了适配生成模型而简化表示,而是保留高容量、可解码的文本潜变量,并设计扩散模型直接学习其分布。
我们提出AURORA-LM,一种连续潜空间扩散语言模型,它将可解码文本表示的构建与其分布的建模分离。基于查询的编码器-解码器将文本组织为高容量、前缀对齐的潜序列,而块因果扩散Transformer通过流匹配学习其分布,从左到右生成块,同时并行去噪每个块内的位置。由于此类潜变量对扩散建模更具挑战性,AURORA-LM仅限制噪声输入路径,同时保留完整的干净潜变量预测目标,从而在不降低解码器端容量的情况下容纳全宽度潜变量。我们进一步将噪声水平分布校准至潜变量宽度,并引入自轨迹一致性,以桥接独立采样的训练噪声与推理时的迭代去噪。
AURORA-LM在OpenWebText自由生成和XSum摘要任务上,于所评估的连续和基于扩散的语言模型中取得最强性能。扩展至10亿参数、总计算量约1500 EFLOPs后,性能进一步提升,在匹配的评估协议下超越了更大的公开潜扩散语言模型。所有实验均在昇腾NPU上进行。
译自 Hugging Face · Daily Papers · arXiv:2608.02602 · 录于 二〇二六年八月五日