DeepMind · 官方

Gemini 3.5 Live Translate 实现流畅自然语音翻译

Fluid, natural voice translation with Gemini 3.5 Live Translate

二〇二六年六月九日 · 英文原文

2026年6月9日,Google发布Gemini 3.5 Live Translate,一款用于实时语音到语音翻译的音频模型。该模型自动检测70多种语言,保留说话者语调、语速和音高,延迟仅几秒。通过Gemini Live API、Google AI Studio提供公开预览,本月起在Google Meet中私有预览,并在Android和iOS的Google翻译应用中推出。所有生成音频使用SynthID添加水印。合作伙伴Grab正在测试该模型。

2026年6月9日

阅读时间6分钟

Gemini 3.5 Live Translate 是我们最新的音频模型,可在超过70种语言中实现近乎实时的语音到语音翻译。

A

Anuda Weerasinghe

产品经理

T

Tony Lu

高级职员软件工程师

图片1:文字"Gemini 3.5 Live Translate"旁有闪烁星光

二十年前,Google 翻译作为我们开创性的机器学习实验之一起步,旨在将语言科学转化为人际连接的魔力。如今,这项实验已取得长足进步,每月通过我们的产品为数十亿用户翻译超过一万亿个单词。

今天,我们迈出新的一步,发布 Gemini 3.5 Live Translate——我们用于实时语音到语音翻译的最新音频模型。

该模型能自动检测70多种语言,并生成流畅、自然的翻译语音,同时保留说话者的语调、语速和音高。与等待说话者说完才响应的逐轮系统不同,3.5 Live Translate 持续生成语音,在等待上下文以提高质量与立即翻译以保持与说话者同步之间取得平衡。它提供流畅的音频,没有尴尬的停顿,在整个会话过程中仅比说话者延迟几秒。

Gemini 3.5 Live Translate 从今天起开始在 Google 产品中推出:

使用 3.5 Live Translate 进行开发

Gemini 3.5 Live Translate 在语音流式传输时进行处理,实现跨语言的更无缝连接。该模型处理多语言输入,无需手动配置设置。同时,其噪声鲁棒性确保应用能够应对嘈杂、不可预测的环境。您可利用其能力,为多语言通话、会议、课程、广播等场景提供实时口译支持。

观看 Gemini Live API 的实际应用,实现配音和同步多语言翻译。深入了解 demo 或 Gemini Cookbook 中的更多示例代码

通过利用 Gemini Live API,像 AgoraFishjamLiveKitPipecatVision Agents 这样的开发者平台,使开发者能够轻松构建和部署语音翻译应用。这些集成处理复杂的实时媒体流基础设施,让开发者可以专注于用户体验。

我们的合作伙伴 Grab 正在测试该模型,以实现司机与乘客在接载点之间近乎实时的多语言沟通。这些用户每月通过 Grab 进行超过1000万次语音通话。

了解 Grab 如何测试 3.5 Live Translate 以改变用户之间的沟通方式。

阅读早期评价

除了 Grab,CJ ENM、LiveKit 等公司也对 3.5 Live Translate 给予了积极反馈,称赞其出色的翻译质量、准确性和低延迟:

在测试 Gemini 3.5 Live Translate 时,我们看重其自动检测多种语言并以低延迟准确翻译语音的能力。

在视频会议中体验 3.5 Live Translate

Google Meet 中的功能将很快使用 3.5 Live Translate,通过以下方式改善体验:

我们从本月起向选定的企业 Google Workspace 客户以私有预览形式推出此更新,随后将在今年晚些时候更广泛地推出。

Google Meet 参与者使用语音翻译在英语、普通话和瑞典语之间进行沟通。

在 Android 或 iOS 上的 Google 翻译应用中获取 3.5 Live Translate

该模型也正在全球范围内的 Google 翻译应用中推出,适用于 AndroidiOS。使用实时翻译功能时,只需连接任意一副耳机,即可体验更无缝的翻译,该翻译能反映说话者的语气,覆盖70多种语言。

对于 Android 用户,我们还开始推出一种新的“聆听模式”,该模式使用 3.5 Live Translate,让您可以直接通过手机听筒听到翻译。只需像普通通话一样将手机贴近耳朵,翻译后的音频就会直接传输给您。当您想快速听到翻译但不想让其他人听到,且手边没有耳机时,这种新体验会很有帮助。

使用新的聆听模式,用户可以直接通过手机听筒听到西班牙语导游讲解的近乎实时的英语翻译。

使用 SynthID 添加水印

我们模型生成的所有音频都使用 SynthID 添加了水印。这种不可察觉的水印直接嵌入音频输出中,确保 AI 生成的内容保持可检测性,以帮助防止错误信息。有关我们安全与责任方法的详细信息,请查阅模型卡片

在收件箱中获取更多来自 Google 的故事。

完成。只需再一步。

检查您的收件箱以确认订阅。

您已订阅我们的新闻通讯。

您也可以使用以下方式订阅

相关故事

译自 DeepMind · 官方 · 录于 二〇二六年六月九日