GPT-Live 发布
Introducing GPT‑Live
OpenAI 在 ChatGPT 应用中推出 GPT‑Live,升级了语音模式所使用的模型。GPT‑Live 在后台使用 GPT‑5.5,可将需要网络搜索或深层推理的任务分流至最新前沿模型,并在准备就绪后返回结果,同时保持对话流畅。此前语音模式基于 GPT-4o 时代模型,知识截止于 2024 年。预览期间用户发现模型会打断对话并发出不当笑声,OpenAI 已对此进行调整。
推出 GPT‑Live
OpenAI 终于升级了 ChatGPT 语音模式所使用的模型!我在 iPhone 应用中获得了数周的预览权限,新模型的表现令人印象深刻。它还能将更困难的任务分流至 GPT-5.5:对于需要网络搜索、更深层推理或更复杂工作的问题,它会在后台委托给我们的最新前沿模型,并在准备就绪后将结果带回对话中。在运行过程中,GPT‑Live 可以继续与你交谈,保持对话的流畅性。上线时,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们将持续更新 GPT‑Live 所使用的模型。
ChatGPT 应用之前的语音模式基于 GPT-4o 时代的模型,知识截止日期在 2024 年某个时间点。我基本上已经停止使用语音模式,因为该模型年代久远且相对较弱,大大限制了它作为头脑风暴伙伴的实用性。在预览期间,我遇到了一个相当隐蔽的 bug:模型会打断我,对我说的内容发笑,而这些内容甚至并非玩笑!这让我感到粗鲁且居高临下——我向 OpenAI 报告了此事,据我所知,他们做了一些调整,现在这种情况不太可能发生了。
回顾我的对话记录,我认为是这段内容触发了打断式的笑声:那么猫头鹰在不活动的时候,比如黄昏之前,它们在哪里?猫头鹰是存在的,对吧?它们躲在洞里吗?它们藏在哪里?
我与新模型最长的一次对话是在遛狗(并拍摄鹈鹕照片)时持续了整整一个小时。我至今还没能拍到猫头鹰的照片。
via Hacker News
标签:text-to-speech , ai , openai , generative-ai , llms , multi-modal-output , llm-release , speech-to-text