旧版AI模型急诊诊断已超越人类医生
TL;DR · AI 摘要
OpenAI的o1模型在急诊诊断中表现优于人类医生,准确率高达67%,尤其是在早期分诊阶段。
核心要点
- o1模型准确率为67%,高于人类医生的50-55%
- 模型在临床推理方面接近完美
- 模型测试仅覆盖短期急诊,未包括长期住院
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI模型在急诊诊断中的表现
金句 / Highlights
值得收藏与分享的关键句。
A new study published in Science shows OpenAI's o1 model outperformed ER physicians at diagnosing patients, identifying the correct or near-correct diagnosis 67% of the time versus 50–55% for doctors.
The model also scored near-perfect on clinical reasoning in structured cases, far ahead of attending physicians.
The performance gap was widest exactly where mistakes are most dangerous, early in the ER process when doctors have incomplete information and are under time pressure.
标题:Chubby♨️ 在 X 上:“医生不咨询 AI 是不道德的!
一篇发表在《科学》杂志上的新研究表明,OpenAI 的 o1 模型(不是 5.5,而是超过一年的 o1!)在诊断患者方面优于急诊科医生,正确或接近正确的诊断率为 67%,而医生的诊断率仅为 50-55%。[https://t.co/UAtwzAgv99]"/ X
来源 URL:https://x.com/kimmonismus/status/2053549177670689001
发布时间:Sun, 10 May 2026 22:13:01 GMT
Markdown 内容:
医生不咨询 AI 是不道德的!一篇发表在《科学》杂志上的新研究表明,OpenAI 的 o1 模型(不是 5.5,而是超过一年的 o1!)在诊断患者方面优于急诊科医生,正确或接近正确的诊断率为 67%,而医生的诊断率仅为 50-55%,尤其是在早期分诊时信息有限的情况下。该模型在结构化病例中的临床推理得分接近完美,远远领先于主治医师。再次强调:这是一个超过一年的模型,在人工智能时代已经算是“老”了。这是首次有研究测试语言模型在真实的、复杂的急诊数据上,而不是经过精心编纂的教科书案例。性能差距最大的地方正是最危险的地方,即急诊过程的早期阶段,此时医生的信息不完整且时间紧迫。而且,测试的模型(o1)已经过时,这意味着当前的模型可能更好。该研究仅涵盖了短暂的急诊接触,而非长时间住院期间积累多日的数据。此外,该研究也没有测试模型在影像学(扫描、X光)上的表现,而这在许多实际诊断中至关重要。下一步是证明这些系统在实际应用中是否真的能改善患者预后,而不仅仅是通过控制比较得出的结果。但我打赌这些模型在这样的案例中也会优于人类医生。