推出 GPT-Live
Introducing GPT-Live
2026年7月8日,OpenAI推出GPT‑Live,一种基于全双工架构的新一代语音模型,支持ChatGPT Voice。GPT‑Live能同时听和说,通过“嗯”等短语表明倾听,实现快速互动或静默等待。它是最智能的语音模型,后台委托GPT‑5.5处理网络搜索、推理等复杂任务,保持对话流畅。两个版本GPT‑Live‑1和GPT‑Live‑1 mini逐步向全球ChatGPT用户推出,计划引入API供开发者使用。
2026年7月8日
新一代语音模型,让人机交互更自然,现已为 ChatGPT Voice 提供支持。
加载中…分享我们正在推出 GPT‑Live,这是一代新的语音模型,让与 AI 的对话更像真实的交流。
GPT‑Live 基于全双工架构构建,意味着它可以同时听和说。在对话中,GPT‑Live 可以通过“嗯”或“对”这样的短语来表明它在认真倾听,能够快速来回互动,或者在你需要思考时保持安静。结果是一种令人耳目一新的、易于交谈的语音体验。
GPT‑Live 也是我们迄今为止最智能的语音模型。对于需要网络搜索、更深层推理或更复杂工作的提问,它会在后台委托给最新的前沿模型,并在准备好时将结果带回对话中。在后台处理时,GPT‑Live 可以继续与你交谈,保持对话流畅。上线时,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们会持续更新 GPT‑Live 所使用的模型。
这些进步为新的 ChatGPT Voice 体验提供了动力,使其更智能、更自然。随着时间的推移,我们相信这项研究还将解锁使用语音进行日益复杂、更长时间运行、更具 agent 性的工作的能力。
我们今天开始向全球 ChatGPT 用户逐步推出两个版本的 GPT‑Live——GPT‑Live‑1 和 GPT‑Live‑1 mini。我们还计划很快将其引入 API,开发者和企业可以通过此表单注册以接收通知。
进入人机交互的新时代我们的愿景是实现真正自然的人机交互:一个与 AI 协作就像与另一个人合作一样流畅和响应迅速的世界,同时推理和复杂任务执行在后台无缝进行。
旧一代的语音 AI 系统让我们更接近这一愿景,但伴随着重要的权衡。
级联语音系统依赖一系列模型依次处理每一轮对话。最初的 ChatGPT Voice 将三个模型串联在一起:一个语音转文本模型来转录你的语音,一个大型语言模型来生成回复,以及一个文本转语音模型将其转换回语音。这种方法使我们首次能够与前沿 AI 模型对话,但复杂性也带来了代价:信息可能在模型间丢失,且回复缓慢且生硬。
缓慢且生硬的回复,长时间的停顿