OpenAI WebRTC 音频会话,现支持文档上下文
OpenAI WebRTC Audio Session, now with document context
摘要
OpenAI 于2024年12月推出 WebRTC 音频会话工具,用于与其实时音频模型交互。上个月,OpenAI 为该 API 引入新模型 GPT-Realtime-2,号称“首个具备 GPT-5 级别推理能力的语音模型”,知识截止日期为2024年9月30日。该模型尚未在 ChatGPT iPhone 应用上线。用户现可在浏览器中选择该模型,并粘贴文档上下文,围绕指定信息进行音频对话。
OpenAI WebRTC 音频会话,现已支持文档上下文
我在2024年12月构建了这个工具的第一个版本,用于试用当时新推出的OpenAI WebRTC API,以便与其实时音频模型进行交互。上个月,OpenAI为该API引入了一个全新的模型,名为GPT‑Realtime‑2,他们将其宣传为“我们首个具备GPT‑5级别推理能力的语音模型”——知识截止日期为2024年9月30日。我一直在等待这个模型出现在ChatGPT iPhone应用中,但它至今仍未上线,因此我重新审视了我之前的实验工具。现在你可以选择更优的模型,也可以粘贴一大段文档上下文,从而在浏览器中围绕你认为适合以对话方式探索的任何信息进行音频对话。
标签:audio, tools, ai, openai, generative-ai, llms, multi-modal-output, webrtc
译自 Simon Willison · 博客 · 录于 二〇二六年六月十三日