OpenAI Blog

Using AI to help physicians diagnose rare genetic diseases affecting children

8.5内容质量

TL;DR · AI 摘要

AI辅助诊断罕见遗传病,提升4.8%确诊率,OpenAI模型助力医学研究。

核心要点

  • OpenAI o3模型帮助18例未确诊病例获得诊断,提升4.8%确诊率。
  • AI模型不直接诊断,而是提供证据关联的假设供专家进一步验证。
  • 随着科学知识更新,旧病例可能因新发现而获得新答案。

结构提纲

按章节快速跳转。

  1. 许多罕见遗传病患者即使经过基因测序也难以确诊,AI可能提供新解决方案。

  2. 研究人员使用OpenAI o3模型分析376例未确诊病例的临床和基因数据。

  3. AI模型帮助18例病例获得诊断,提升4.8%确诊率,专家进一步验证后确认。

  4. AI模型不直接诊断,而是提供证据关联的假设供专家进一步验证。

  5. AI模型不参与临床决策,仅作为辅助工具提供假设。

  6. 随着科学知识更新,旧病例可能因新发现而获得新答案,AI可提高再分析效率。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI辅助诊断罕见遗传病
    • 研究背景
      • 罕见遗传病确诊率低
      • 基因测序难以发现关键信息
    • 研究方法
      • 使用OpenAI o3模型分析376例未确诊病例
      • 模型提供证据关联的假设
    • 研究结果
      • 18例病例获得诊断,提升4.8%确诊率
      • 专家进一步验证后确认

金句 / Highlights

值得收藏与分享的关键句。

#AI#医学#遗传病#OpenAI#NEJM AI
打开原文

标题:利用 AI 帮助医生诊断影响儿童的罕见遗传疾病

URL 来源:https://openai.com/index/diagnose-rare-childhood-diseases

即使有了基因组测序,许多患有罕见疾病的人仍然无法获得明确的遗传诊断。大约一半的患者在经过广泛的检测和专家评审后仍无法确诊。他们的医疗数据中可能包含线索,但找到这些线索可能需要在成千上万甚至数百万种可能的遗传变异、零散的临床记录以及不断变化的科学文献中进行筛选。

随着新的基因-疾病关系、病例报告和分类证据的积累,一些未解决的病例可能会变得可以解释。

来自波士顿儿童医院 Manton 遗传病研究中心、哈佛大学和 OpenAI 的研究人员使用了 OpenAI o3 Deep Research 推理模型,分析了 376 个此前分析但仍未解决的病例的去标识化临床和基因组信息。该模型为研究人员和临床医生提供了与证据相关的候选解释。在专家评审、进一步检测和临床确认后,医生在 18 个病例中建立了诊断,这比专家之前的分析增加了 4.8% 的诊断率。这项研究于 2026 年 6 月 18 日发表在《NEJM AI》上,展示了 AI 辅助研究工作流程如何帮助专家在重新审视一些最困难的病例时生成线索。

这些病例中的许多已经逃避了多年的专家分析。在本研究中,OpenAI o3 Deep Research 帮助研究人员识别了后来通过既定临床流程进行评估的线索,表明随着知识的演变,专家主导的定期重新分析可能会变得更加可扩展。该模型并未对任何患者进行诊断或做出任何临床决策。它为专家提供了与证据相关的假设,专家可以在适当的情况下通过进一步的检测并在临床实验室中确认这些假设。

为什么一个旧病例可能包含一个新答案

一个不明确的基因检测结果并不总是永久性的发现。患者的表型描述、检测结果和家族史可能分散在使用不同标识符、格式和词汇的数据库中。将这些记录联系起来很困难,因此即使专家也可能错过诊断。专家可能在相关基因或其变异与疾病联系之前就对儿童的基因组进行测序。随着科学知识的进步,相同的数据可能会揭示以前无法发现的答案。

罕见病的重新分析既是科学问题,也是维护问题。患者的基因组可能保持不变,但围绕它的证据却在不断变化:研究人员将新的基因和变异与疾病联系起来,实验室重新分类旧的变异,病例数据库和论文积累新的观察结果。每次更新都可能使一个旧的不明确病例值得重新审视,因此许多机构继承了越来越多的基因组,以保持与不断变化的知识库同步。

在本研究中,研究人员设计了工作流程,使模型作为现有基因组流程上的一个以解释为先的推理层。它不是只返回一个排名靠前的基因,而是被要求将临床特征、遗传模式、变异证据和科学文献联系起来,形成一个人类评审者可以进行质疑的解释。

重新分析是如何进行的

对于每例病例,团队组装了一个去标识化的数据包,其中包含标准化的人类表型本体(Human Phenotype Ontology)术语,用于描述患者的临床表现、偶尔的临床医生笔记和任何描述性的临床诊断,以及诸如年龄和性别等元数据,还有一个经过筛选的变异表。该表格记录了每个变异的罕见程度、其对编码蛋白的预测影响、ClinVar分类以及在可用家庭成员中的信号质量。大多数病例包括了孩子和两位生物学父母的数据。

团队要求模型提出最可能的分子解释并展示其推理过程。研究人员随后使用与临床实验室相同的ACMG/AMP框架审查模型的输出,以对遗传变异进行分类。每个候选方案至少由两名团队成员审查,意见分歧通过共识解决,且模型的输出从未被当作诊断。只有在合格专家审查了证据、变异被分类为致病性或可能致病性、CLIA认证实验室确认后,并且临床团队将结果返回给家庭时,发现才被算作诊断。

在分析未解决的病例之前,团队在已确诊的病例上优化了工作流程。在51个包含各种罕见疾病的病例中,该流程在重复运行中正确识别了48个病例的基因和变异。在一组57个神经肌肉病例中,该流程在重复运行中正确诊断了45个病例。在一组15个长读基因组病例中,该流程在所有病例中都正确识别了致病基因,并在12个病例中正确识别了两个致病等位基因。这些评估有助于快速开发,并展示了专家审查仍然至关重要的地方。

在这些之前已解决的病例中,模型的自我报告置信度评分与正确诊断一致:对于始终正确的诊断,平均最低评分为85.6;对于错误或未知的诊断,平均最低评分为42.1。这些评分并不是校准后的概率,团队也没有将其用作证据或临床裁定的替代。但它们在指导专家审查人员关注最有希望的候选诊断方面是有帮助的。

研究人员发现的结果

随后,团队将该工作流程应用于四个此前未解决的病例组:患有神经发育障碍的儿童、患有罕见神经肌肉疾病的人、患有早期精神病的儿童和青少年,以及儿科中突然意外死亡的病例。这些病例并非等待首次审查的新病例。许多病例已经由多个商业或机构流程检查过,并由多学科团队讨论过。

按群体划分的结果

群体 | 病例数 | 发现的诊断数 | 诊断率 ---|---|---|--- 神经发育障碍 | 100 | 10 | 10.0% 神经肌肉疾病 | 61 | 4 | 6.6% 儿科中突然意外死亡 | 200 | 2 | 1.0% 早期精神病 | 15 | 2 | 13.3% 总计 | 376 | 18 | 4.8%

早期精神病群体的样本量较小,因此其百分比具有较宽的置信区间。诊断率也反映了每个群体更有可能存在单基因解释的可能性。

在模型提出候选方案并由专家完成审查和临床确认后,医生在4.8%的病例中建立了诊断。这一比例虽然不高,但在该人群中具有重要意义,因为之前的专家审查未能解决这些病例。类似的研究报告在经过大量审查的病例中,诊断率通常只提高了个位数;更高的诊断率通常来自包含新病例或等待基因确认的已知疾病的研究。

在18个诊断中,有7个是重新发现的:这些诊断是在本地研究工作流程之外得出的,但未包含在团队审查的记录中。在一些情况下,这些变异体已经在公共数据库中被列为致病性或可能致病性,这突显了在不同数据源之间综合信息所面临的操作挑战。

在识别变异时展示灵活性

在一个早期精神病病例中,模型推断出基因组中存在一个未在输入数据中列出的结构事件。它将染色体22上的一段低质量读数与该儿童的心脏、免疫、神经发育和精神疾病特征联系起来,然后假设存在与迪乔治综合征相关的22q11.2缺失。这一假设的变异体通过后续的基因组测序得到了证实。

尽管提示要求找出一个单基因原因,但模型有时会提出两个基因,这两个基因更能解释复杂的临床表现。在其中一个病例中,_LAMA2_和_FOXP1_的变异共同解释了肌肉和神经发育特征;另一个病例则涉及之前未被认识到的双基因解释,涉及_TTN_和_SRPK3_。

生成可验证且生物学上一致的假设

除了诊断之外,该模型还为一种称为白癜风的疾病提出了一种可能的新机制解释。在一个神经发育病例中,模型突出了一个患有白癜风的人在_S1PR1_基因中存在一个11个氨基酸的缺失。_S1PR1_编码一种参与信号传导、免疫细胞移动和组织生物学的细胞表面受体。模型整合了表明该缺失可能通过改变受体结构和信号传导方式,从而减少色素生成,同时帮助免疫细胞在皮肤中持续存在的证据。

所提出的_S1PR1_与白癜风之间的关系需要进一步的实验验证,但它展示了人工智能在将结构生物学、免疫学和临床遗传学中的零散发现转化为具体、可验证假设方面的强大作用。

研究团队还观察到神经肌肉队列中可能存在表型扩展。_HSPB8_和_CDK13_中的有害变异并未完全匹配这些基因最著名的疾病,这表明需要更多的病例和实验室工作来验证更广泛的临床谱系。

局限性

这项研究表明,一个通用的推理模型可以通过将表型、遗传方式、变异注释、数据质量模式和科学文献结合起来,为回顾性基因组重新分析做出贡献。它还说明了为什么定期重新分析很重要:一些答案只有在知识进步或零散的记录被整合之后才会浮现。

本研究并不是患者、临床医生或客户使用OpenAI模型进行疾病诊断或做出医疗决策的证据。它并未描述或支持将OpenAI o3 Deep Research、ChatGPT或任何其他OpenAI产品用于诊断的客户使用意图。该模型并未对任何参与者进行诊断;所有诊断均由医生和其他合格的临床专家通过既定的审查、测试和临床确认流程完成。

该研究是回顾性的,队列具有异质性,审阅者并未对模型的置信度进行盲评。研究人员没有测量节省的时间、成本、临床医生的努力、假阳性工作量或护理方式的变化。他们也没有系统地评估其他形式的遗传变异,例如结构变异、重复扩增、深内含子变化或嵌合现象。

大型语言模型可能会误解上下文,或生成看似合理但经进一步检查后失败的解释。因此,每项结果都经过了人工裁定和临床确认。模型扩展了搜索范围,并聚焦于后续由人类主导的分析;它并未决定应向家庭返回哪些信息或诊断。

本研究使用了去标识化信息,未在批准的环境之外使用或传输任何受保护的健康信息。更广泛的临床部署将需要与所有医疗服务一样,同样关注隐私、安全、可审计性和地方法规。模型访问并不能替代测序基础设施、遗传咨询、确认性检测或专家判断。

Catherine Brownstein 博士,波士顿儿童医院 Manton 遗传病研究中心主任

Alan Beggs,Manton 遗传病研究中心主任

接下来是什么

前瞻性、多中心研究应将基于大型语言模型的重新分析与标准实践进行比较,评估其在诊断率、找到候选基因的时间、临床医生的努力、假阳性负担、成本以及对护理的影响。版本化提示、参考检查、审计日志和校准的不确定性对于可重复性和安全性至关重要。此类研究仍需要合格的临床医生来评估证据、订购适当的检测,并做出任何诊断或治疗决策。

本研究使用了 OpenAI o3 Deep Research 模型。更新的通用模型可以搜索和综合更多的科学材料,而专门构建的系统,如 GPT-Rosalind,则旨在进行更深入的生命科学工作,包括变异对蛋白质结构和功能的影响。这些功能在此研究中未经过测试,将需要各自的评估和访问控制。

虽然 OpenAI 帮助支持了这项初步研究,但 Manton 中心将通过 OpenAI 基金会的资助,领导下一步的工作。该资助将支持中心更广泛的计划,即开发一个平台无关、低成本的遗传学 AI 协助工具,帮助临床团队更快、更一致地分析罕见病病例。

长期的研究机会是探索专家主导的 AI 辅助重新分析是否有助于科学理解与发现保持同步。AI 并不是要取代医生的诊断,而是经过仔细评估的研究工具可能帮助专家识别值得进一步研究的证据。对于成千上万的家庭而言,今天未解答的问题不必永远无法解答。