Hugging Face · 官方博客

Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

Hugging Face and Cerebras bring Gemma 4 to real-time voice AI

二〇二六年七月一日 · 英文原文

Hugging Face与Cerebras合作展示了一个开放的、模块化的级联语音到语音(Speech-to-Speech)架构。该流水线使用Nvidia的Parakeet进行语音识别,在Cerebras上运行Google DeepMind的Gemma 4 31B VLM进行推理,并通过阿里巴巴的Qwen3TTS完成文本转语音。该系统旨在降低延迟,使对话响应更接近人类交互速度,已为超过9000台Reachy Mini机器人提供动力。

](https://huggingface.co/A-Mahla)

图片2:Andres Marafioti 的头像

图片3:Leandro von Werra 的头像

图片4:Saurabh Vyas 的头像

视频3

对于语音 AI 来说,延迟是一个关键参数。开发者在模型质量上取得了巨大进步,但用户体验仍常常受限于响应时间。Hugging Face 和 Cerebras 正在改变这种体验。今天,我们展示了一个开放的、模块化的语音 AI 架构与业界领先的推理速度相结合时,能够实现怎样的可能。

其结果是带来一种感觉上自然得多的语音到语音体验。对话不再需要等待 AI 响应,而是以用户期望于人类互动的响应速度流畅进行。

架构:一个开放的、级联的语音到语音栈

该演示构建为一个实时的语音到语音流水线。系统的每个部分都是模块化、开放且可替换的,这使得开发者能够轻松地将该栈适配到不同的助手、机器人、产品或研究项目中。

这创建了一个完全开放的语音到语音循环:

语音输入
  -> 使用 Nvidia 的 Parakeet 进行语音识别
  -> 在 Cerebras 上进行 Gemma 4 VLM 推理
  -> 使用阿里巴巴的 Qwen3TTS 进行文本转语音
  -> 语音响应

该架构汇聚了开源 AI 生态系统的优势:Cerebras 提供快速推理,Google DeepMind 的 Gemma 4 31B 作为语言模型,Qwen 负责文本转语音。每一层都可以被开发者检查、修改和扩展。

Cerebras 与 Hugging Face 的合作

如今,一些生产系统虽然中位延迟尚可,但在 P95 分位仍会经历令人沮丧的数秒延迟。当工具调用或多模态步骤需要多轮交互时,这些延迟会变得更加明显。

Cerebras 帮助解决了该栈中最重要的瓶颈之一:语言模型的响应时间。通过使推理速度显著加快且更加稳定,Cerebras 让 Hugging Face 流水线的其余部分得以充分发挥其优势。

这种稳定性在长尾分布中尤其重要。许多系统能够提供可接受的中位响应时间,但偶尔的慢响应仍会让对话感觉不可靠。

为真实世界交互而构建

同样的 Hugging Face 语音到语音流水线已经为 Reachy Mini 机器人提供动力,目前已有超过 9000 台机器人在实际环境中运行。对于机器人、语音助手和具身 AI 来说,响应速度并非锦上添花的改进,而是让交互感觉有生命力的关键。

因此,使用 Cerebras 的动机不仅仅是降低成本。它关乎低延迟、可预测的性能,以及大规模创建感觉自然的实时体验的能力。

这次合作反映了一个共同的信念:AI 的未来将是开放且高性能的。开源模型、开放基础设施以及突破性的推理速度,共同为下一代对话式 AI 奠定了基础。

我们邀请开发者探索这个演示,尝试其代码,并帮助塑造实时语音 AI 的未来。

演示:Hugging Face Space

代码仓库:huggingface/speech-to-speech

译自 Hugging Face · 官方博客 · 录于 二〇二六年七月一日