Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI
Hugging Face and Cerebras bring Gemma 4 to real-time voice AI
Hugging Face与Cerebras合作展示了一个开放的、模块化的级联语音到语音(Speech-to-Speech)架构。该流水线使用Nvidia的Parakeet进行语音识别,在Cerebras上运行Google DeepMind的Gemma 4 31B VLM进行推理,并通过阿里巴巴的Qwen3TTS完成文本转语音。该系统旨在降低延迟,使对话响应更接近人类交互速度,已为超过9000台Reachy Mini机器人提供动力。
](https://huggingface.co/A-Mahla)
对于语音 AI 来说,延迟是一个关键参数。开发者在模型质量上取得了巨大进步,但用户体验仍常常受限于响应时间。Hugging Face 和 Cerebras 正在改变这种体验。今天,我们展示了一个开放的、模块化的语音 AI 架构与业界领先的推理速度相结合时,能够实现怎样的可能。
其结果是带来一种感觉上自然得多的语音到语音体验。对话不再需要等待 AI 响应,而是以用户期望于人类互动的响应速度流畅进行。
架构:一个开放的、级联的语音到语音栈
该演示构建为一个实时的语音到语音流水线。系统的每个部分都是模块化、开放且可替换的,这使得开发者能够轻松地将该栈适配到不同的助手、机器人、产品或研究项目中。
这创建了一个完全开放的语音到语音循环:
语音输入
-> 使用 Nvidia 的 Parakeet 进行语音识别
-> 在 Cerebras 上进行 Gemma 4 VLM 推理
-> 使用阿里巴巴的 Qwen3TTS 进行文本转语音
-> 语音响应
该架构汇聚了开源 AI 生态系统的优势:Cerebras 提供快速推理,Google DeepMind 的 Gemma 4 31B 作为语言模型,Qwen 负责文本转语音。每一层都可以被开发者检查、修改和扩展。
Cerebras 与 Hugging Face 的合作
如今,一些生产系统虽然中位延迟尚可,但在 P95 分位仍会经历令人沮丧的数秒延迟。当工具调用或多模态步骤需要多轮交互时,这些延迟会变得更加明显。
Cerebras 帮助解决了该栈中最重要的瓶颈之一:语言模型的响应时间。通过使推理速度显著加快且更加稳定,Cerebras 让 Hugging Face 流水线的其余部分得以充分发挥其优势。
这种稳定性在长尾分布中尤其重要。许多系统能够提供可接受的中位响应时间,但偶尔的慢响应仍会让对话感觉不可靠。
为真实世界交互而构建
同样的 Hugging Face 语音到语音流水线已经为 Reachy Mini 机器人提供动力,目前已有超过 9000 台机器人在实际环境中运行。对于机器人、语音助手和具身 AI 来说,响应速度并非锦上添花的改进,而是让交互感觉有生命力的关键。
因此,使用 Cerebras 的动机不仅仅是降低成本。它关乎低延迟、可预测的性能,以及大规模创建感觉自然的实时体验的能力。
这次合作反映了一个共同的信念:AI 的未来将是开放且高性能的。开源模型、开放基础设施以及突破性的推理速度,共同为下一代对话式 AI 奠定了基础。
我们邀请开发者探索这个演示,尝试其代码,并帮助塑造实时语音 AI 的未来。