提升ChatGPT中的健康智能
Improving health intelligence in ChatGPT
每周超过2.3亿人通过ChatGPT获取健康帮助。OpenAI借助GPT-5.5 Instant在健康评估中达到与前沿Thinking模型相当的水平,该模型已向所有免费用户开放。OpenAI与来自60个国家、涵盖49种语言和26个医学专业的260多名医生合作,审查了超过70万条模型回复。在3,500条回复的医生对比评估中,GPT-5.5 Instant在准确性、沟通能力、完整性等指标上均高于医生撰写的回复和旧版模型。过去两个月,生产流量中健康回复的事实性问题率下降了71%。
健康是人们使用 ChatGPT 最有意义的方式之一。每周,超过 2.3 亿人向 ChatGPT 寻求健康和保健方面的帮助:理解健康信息、解读化验结果、为就诊做准备、处理保险事宜、养成更健康的习惯,以及弄清楚接下来该问什么。
借助 GPT‑5.5 Instant,我们在健康领域看到了显著的进步,包括在识别何时可能需要紧急护理、询问相关背景信息、解释不确定性,以及让复杂信息更易于理解等方面的改进。在我们最具挑战性的健康评估中,GPT‑5.5 Instant 的表现现已达到与我们前沿 Thinking 模型相当的水平。由于所有 ChatGPT 免费用户均可使用它,因此更多人能够从这些改进中受益。
这一进步既反映了模型能力的提升,也体现了我们健康评估背后由医生主导的工作。在我们的各项努力中,一个由全球医生组成的网络通过审查示例模型回复、描述理想行为以及识别失败模式,帮助定义在真实健康场景中“好”的标准。与医生合作让我们能够衡量健康领域的进展,并随着时间的推移改进 ChatGPT 的回复方式。
衡量健康领域的进展
在健康领域,进步意味着提供准确、易于理解且基于良好判断的回复:识别何时需要更多背景信息,解释不确定性时不夸大信心,并帮助人们理解何时应寻求医疗护理。
为了衡量这一进展,我们使用了针对健康领域的评估,包括 HealthBench 和 HealthBench Professional(在新窗口中打开)。这些评估使用真实的健康对话和医生编写的评分标准来评估准确性、安全性、沟通能力、上下文感知能力、完整性以及适当的升级处理等品质。
GPT‑5.5 Instant 在包括 HealthBench Professional 在内的健康评估综合指标上,达到了与我们最新前沿模型相当的健康表现,相比 GPT‑5.3 Instant 有了显著提升。5.5 Instant(2026 年 5 月发布)和 5.3 Instant(2026 年 3 月发布)可供 ChatGPT 的所有免费用户使用(受限于使用限制),我们使用 API 定价来计算 5.4 Thinking 和 5.5 Thinking 的成本。
作为另一项对比,我们请医生为具有代表性的健康对话撰写回复,不限时间并可访问互联网(但不能使用 AI)。随后,一个独立的医生小组将这些医生回复与模型回复随时间进行对比,审查在真实互动中重要的品质,包括准确性、沟通能力、完整性、指令遵循以及健康决策帮助性,共审查了 3,500 条回复。
在此评估的各项标准中,GPT‑5.5 Instant 的回复评分均高于医生撰写的回复和旧版模型的回复。
医生认为,GPT‑5.5 Instant 回复的失败模式少于旧版模型和医生。例如,与旧版模型和医生相比,GPT‑5.5 Instant 在未能根据当地医疗环境进行调整、遗漏警示信号或转诊建议、或在需要时未能向用户寻求更多背景信息等方面的情况更少。
鉴于我们的模型在健康领域的使用规模,理解近期模型改进的另一种方式是衡量生产流量。我们在生产流量上使用隐私保护监控器来追踪健康回复中可能的事实性问题。根据对近期健康领域生产流量(每周数十亿条消息)的比较,在过去两个月中,至少存在一个标记事实性问题的回复率下降了 71%。
更好的回复是什么样的
比较模型在真实健康问题上随时间变化的回复,可以看出 ChatGPT 在健康相关方面取得了哪些改进:识别何时情况可能需要紧急关注、以更好的判断力处理不确定性,以及为人们提供更清晰、更有用的下一步行动指导。
进步背后的医学专业知识
这一进步是由医生们塑造的,他们帮助我们定义、衡量和改进 ChatGPT 中的健康回复。
OpenAI 与一个由来自 60 个国家、涵盖 49 种语言和 26 个医学专业的 260 多名医生组成的全球网络合作。他们的反馈指导着 ChatGPT 如何回应各种场景下的健康问题,从日常保健问题到更复杂的临床情况。
医生们审查示例模型回复,并评估其是否准确、清晰、完整、适当谨慎且有用。他们帮助识别回复可能遗漏重要背景信息的地方、听起来过于自信的地方、应该更明确说明下一步行动的地方,或者应该更直接地鼓励某人寻求医疗护理的地方。
迄今为止,医生们已经审查了超过 70 万条反映患者和临床医生在现实世界中如何使用 ChatGPT 的示例模型回复。每隔几分钟,就有一位医生审查一条新回复。他们的反馈成为评分标准和评估标准,帮助研究人员衡量回复在真实健康场景中是否准确、安全、清晰、完整、适当谨慎且有用。这为我们提供了一种更清晰的方式来了解模型在哪些方面变得更好,以及哪些方面仍需改进。
将健康改进带给更多人
这项工作也支持了 OpenAI 在健康领域更广泛的工作,包括为医疗保健构建的工具,例如 ChatGPT for Clinicians 和 OpenAI for Healthcare,这些工具通过文档处理、研究和护理交付等任务为医疗专业人员提供支持。
改善人类健康将是 AGI 最个人化、最切实的影响之一。随着我们的模型不断改进,我们的目标是让 ChatGPT 在这些时刻变得更准确、更有用、更具影响力——并持续将这一进步带给更多人。