Apple · ML Research

解耦时序深度扩散Transformer的高效内存音频合成

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

二〇二六年七月二十九日 · 英文原文

Siri 的语音合成基于 AFM 3 Core Advanced(苹果最强大的设备端基础模型),通过内存高效音频合成架构在设备上实时生成可配置语音。该架构包含一个去分词器(detokenizer),在 Apple Matrix Coprocessor(AMX)的计算和内存预算内将语义音频 token 转换为高保真音频。设计采用三组件结构,流式地将语义音频 token 转换为残差向量量化(RVQ)表示。

Siri 富有表现力的语音通过 AFM 3 Core Advanced(苹果最强大的设备端基础模型)在设备上实时合成丰富、可配置的语音。本文介绍了该能力背后的内存高效音频合成架构:一个去分词器(detokenizer),能够在 Apple Matrix Coprocessor(AMX)严格的计算和内存预算内,将基础模型发出的语义音频 token 转换为高保真音频。我们采用三组件设计——一个流式……将语义音频 token 转换为残差向量量化(RVQ)表示。

译自 Apple · ML Research · 录于 二〇二六年七月二十九日