OpenAI Blog

Improving health intelligence in ChatGPT

8.5内容质量

TL;DR · AI 摘要

ChatGPT 在健康领域取得显著进步,GPT-5.5 Instant 在健康评估中表现接近前沿模型,且对所有免费用户开放。

核心要点

  • GPT-5.5 Instant 在健康评估中表现接近前沿模型,如 HealthBench Professional。
  • GPT-5.5 Instant 的响应在医生评估中优于医生撰写的回答和旧版本模型。
  • GPT-5.5 Instant 于 2026 年 5 月发布,所有免费用户均可使用。

结构提纲

按章节快速跳转。

  1. ChatGPT 在健康领域被广泛使用,每周有超过 2.3 亿人使用它处理健康相关问题。

  2. ·GPT-5.5 Instant 的健康性能提升

    GPT-5.5 Instant 在健康评估中表现接近前沿模型,显著优于 GPT-5.3 Instant。

  3. OpenAI 使用 HealthBenchHealthBench Professional 等评估工具衡量模型在健康领域的表现。

  4. 医生参与定义健康场景中的“良好”表现,并帮助识别模型的失败模式。

  5. 医生评估显示,GPT-5.5 Instant 的响应在多个标准上优于医生撰写的回答和旧版本模型。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • ChatGPT 健康性能提升
    • GPT-5.5 Instant 的性能
      • 接近前沿模型
      • 优于医生撰写和旧版本模型
    • 健康评估方法
      • HealthBench
      • HealthBench Professional
    • 医生参与
      • 定义理想表现
      • 识别模型失败模式

金句 / Highlights

值得收藏与分享的关键句。

  • GPT-5.5 Instant reaches health performance similar to our latest frontier models on an aggregate of health evaluations, including HealthBench Professional, substantially improving from GPT-5.3 Instant

    第 3 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • GPT-5.5 Instant responses were rated higher than physician-written and older model responses across criteria in this evaluation.

    第 5 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • A separate panel of physicians then compared these physician responses with model responses over time, reviewing qualities that matter in real interactions.

    第 4 段

    ⬇︎ 下载 PNG𝕏 分享到 X
#ChatGPT#健康AI#OpenAI#模型评估
打开原文

标题:提升 ChatGPT 的健康智能

URL 来源:https://openai.com/index/improving-health-intelligence-in-chatgpt

健康是人们使用 ChatGPT 的最有意义的方式之一。每周,超过 2.3 亿人向 ChatGPT 寻求健康和福祉相关问题的帮助:理解健康信息、解读化验结果、准备就诊、处理保险问题、培养更健康的生活习惯,以及确定下一步该问什么。

借助 GPT‑5.5 Instant,我们在健康领域取得了显著进展,包括在识别是否需要紧急护理、请求相关上下文、解释不确定性以及使复杂信息更易于理解方面都有所提升。在我们最具挑战性的健康评估中,GPT‑5.5 Instant 的表现现在已达到与我们最前沿的 Thinking 模型相当的水平。由于它对所有免费用户开放,更多人可以从中受益。

这一进展既反映了模型能力的提升,也体现了我们健康评估背后由医生主导的工作。在我们的各项努力中,一个全球性的医生网络通过审查模型响应示例、描述理想行为并识别失败模式,帮助我们定义了在现实世界健康情境中“良好”表现的含义。与医生合作,使我们能够衡量健康领域的进展,并随着时间的推移改进 ChatGPT 的响应方式。

评估健康领域的进展

在健康领域,进步意味着提供准确、易于理解并基于良好判断的响应:识别何时需要更多上下文、在不夸大自信的情况下解释不确定性,以及帮助人们了解何时应寻求护理。

为了衡量这一进步,我们使用了专门针对健康的评估,包括 HealthBench⁠HealthBench Professional⁠(opens in a new window)。这些评估使用现实的健康对话和由医生撰写的评分标准,来评估准确性、安全性、沟通能力、上下文意识、完整性和适当升级等特性。

_GPT‑5.5 Instant 在健康评估(包括 HealthBench Professional)的综合表现上已达到与我们最新前沿模型相当的水平,相比 GPT‑5.3 Instant 有显著提升。5.5 Instant(发布于 2026 年 5 月)和 5.3 Instant(发布于 2026 年 3 月)对所有免费用户开放(受限制条件约束),我们使用 API 定价来计算 5.4 Thinking 和 5.5 Thinking 的成本。_

作为另一个比较,我们请医生为具有代表性的健康对话撰写响应,他们拥有无限的时间和互联网访问权限(但不使用 AI)。然后,另一组医生随时间推移将这些医生撰写的响应与模型响应进行比较,审查真实互动中重要的特性,包括准确性、沟通能力、完整性、遵循指示和健康决策的有用性,共计审查了 3,500 条响应。

_在此次评估中,GPT‑5.5 Instant 的响应在各项标准上的评分均高于医生撰写的响应和旧版模型的响应。_

医生对 GPT‑5.5 Instant 的响应评分高于旧版模型和医生撰写的响应,认为其失败模式更少。例如,GPT‑5.5 Instant 在未能根据本地医疗环境进行调整、遗漏红旗或转介护理、以及在需要时未能向用户寻求更多信息等方面,比旧版模型和医生的响应都更少。

鉴于我们的模型在健康领域的广泛应用,理解近期模型改进的另一种方式是通过衡量生产流量。我们使用隐私保护监控工具对生产流量进行跟踪,以识别健康响应中可能出现的事实性问题。根据最近健康领域生产流量的比较(每周数十亿条消息),过去两个月中,至少包含一个被标记的事实性问题的响应比例下降了71%。

更好的响应表现

通过比较模型在真实世界健康问题上的响应表现,可以看出ChatGPT在健康相关方面有了显著的改进:能够识别出需要紧急关注的情况,以更明智的方式处理不确定性,并为人们提供更清晰、更有用的下一步指导。

推动进步的医学专业知识

这些进步得益于医生们的参与,他们帮助我们定义、衡量和改进ChatGPT中的健康响应。

OpenAI与全球260多名医生合作,这些医生来自60多个国家、49种语言和26个医学专业领域。他们的反馈指导了ChatGPT在各种场景下对健康问题的回应,从日常健康问题到更复杂的临床情况。

医生们会审查模型响应示例,并评估这些响应是否准确、清晰、完整、适当谨慎且有用。他们帮助识别响应中可能遗漏的重要背景信息、可能显得过于自信的地方、需要更明确下一步建议的地方,或者更直接鼓励某人寻求医疗护理的地方。

截至目前,医生们已经审查了超过700,000个模型响应示例,这些示例反映了患者和临床医生在现实世界中如何使用ChatGPT。每隔几分钟,就会有医生审查一个新的响应。他们的反馈转化为评分标准和评估准则,帮助研究人员衡量响应在现实世界健康情境中是否准确、安全、清晰、完整、适当谨慎且有用。这为我们提供了一种更清晰的方式来了解模型在哪些方面得到了改进,以及在哪些方面仍需努力。

将健康改进带给更多人

这项工作也支持OpenAI在健康领域的更广泛努力,包括为医疗保健构建的工具,如面向临床医生的ChatGPT⁠OpenAI医疗保健⁠,这些工具帮助医疗专业人员完成诸如文档编写、研究和护理交付等任务。

提升人类健康将是AGI最个人化、最具体的影响之一。随着我们的模型持续改进,我们的目标是让ChatGPT在关键时刻更加准确、更有用、更具影响力,并继续将这些进步带给更多人。