Apple · ML Research

连续扩散口语语言模型的缩放特性

Scaling Properties of Continuous Diffusion Spoken Language Models

二〇二六年七月七日 · 英文原文

仅语音语言模型(SLM)在性能上落后于文本模型与文本-语音模型,近期离散自回归(AR)SLM 表明匹配文本模型需巨大计算与数据量。为克服连续语音离散化形成的瓶颈,研究者探究了连续扩散(CD)SLM 的可行性,并引入音素 Jensen-Shannon 散度(pJSD)指标量化语言质量。分析显示,CD SLM 与 AR 行为类似,在验证损失与 pJSD 上均表现出缩放定律,并呈现最优的 token 与参数比。

仅语音的语言模型(SLM)在性能上落后于文本模型和文本-语音模型,近期离散自回归(AR)SLM 表明,要匹配文本模型需要巨大的计算量和数据量。由于将连续语音离散化用于 AR 会形成瓶颈,我们探究了连续扩散(CD)SLM 是否更具可行性。为了量化 SLM 的语言质量,我们引入了音素 Jensen-Shannon 散度(pJSD)指标。我们的分析显示,CD SLM 与 AR 行为类似,在验证损失和 pJSD 上表现出缩放定律,并显示出最优的 token 与参数比……

译自 Apple · ML Research · 录于 二〇二六年七月七日