Google Research Blog

Advancing AMIE towards expert-level audio-visual clinical consultations

8.5内容质量
Advancing AMIE towards expert-level audio-visual clinical consultations

TL;DR · AI 摘要

Google推出AMIE(Video)系统,通过实时视频咨询实现专家级医疗诊断,基于Gemini和Project Astra技术,已在肿瘤科等多领域验证。

核心要点

  • AMIE(Video)在模拟咨询中达到专家级诊断水平,基于Gemini和Project Astra技术
  • 系统可实时感知非语言临床线索并指导虚拟体检,提升诊断准确性
  • 与Beth Israel Deaconess Medical Center等机构开展真实世界临床研究

结构提纲

按章节快速跳转。

  1. 介绍AMIE系统从文本咨询向实时视频咨询的突破性进展。

  2. 基于GeminiProject Astra构建实时视频处理能力。

  3. 同步感知非语言线索并指导虚拟体检,实现诊断推理。

  4. 在肿瘤科等三大学科及真实临床场景中验证系统有效性。

  5. Beth Israel Deaconess Medical Center等机构开展临床研究。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AMIE(Video)医疗系统
    • 技术基础
      • Gemini模型
      • Project Astra
    • 核心能力
      • 多模态感知
      • 虚拟体检指导
      • 实时诊断推理
    • 应用领域
      • 肿瘤科
      • 心脏病学
      • 眼科

金句 / Highlights

值得收藏与分享的关键句。

#AMIE#Gemini#医疗AI#实时视频咨询#Project Astra
打开原文

推动AMIE实现专家级视听临床咨询

2026年8月11日

Anil Palepu,高级研究科学家,以及Mike Schaekermann,研究负责人,Google

我们推进AMIE(我们的研究型医疗AI系统),使其能够进行实时视频会诊,并在一项随机对照研究中通过模拟会诊首次展示了专家级性能。

快速链接

  • 论文
  • 分享 复制链接 ×

当医生与患者会面时,会诊远不止于交换的话语。医生观察患者的步态,记录可见的不适迹象,注意其呼吸,并指导患者完成体格检查操作。这种持续的视觉和听觉信息流与口头的临床病史无缝整合。这些非语言的视觉和听觉线索对于有效诊断、患者信任和临床沟通至关重要。

具备临床推理和对话能力的AI系统有潜力显著提升医疗专业知识和护理的可及性,推动未来医生能够将时间集中在患者互动中最有意义的方面。在早期工作中,我们的临床推理和对话研究型AI系统Articulate Medical Intelligence Explorer(AMIE)在基于文本的诊断对话中展示了专家级性能,并被证明是临床医生的有力辅助诊断工具。最近,我们扩展了AMIE的能力,使其超越诊断,向疾病治疗和长期管理迈进。

我们还扩展了AMIE在肿瘤学、心脏病学和眼科学领域的专科级评估能力,并在模拟环境中通过患者演员实现了基于图像和临床文档的多模态诊断推理。同时,我们开始通过以医生为中心的监督框架将这些研究进展转化为临床实践,并开展了首次真实世界临床研究,包括与Beth Israel Deaconess Medical Center合作的临床可行性研究,以及与Included Health合作的全国性随机研究。

尽管取得了这些进展,我们的研究仍存在一个根本性限制:基于文本的界面忽略了临床实践的视觉和听觉维度。患者必须将复杂的体征症状转化为书面描述,这一过程会丢失诊断信息,并可能对数字或健康素养有限的患者产生负面影响。仅基于文本的系统无法独立观察指导临床推理的视觉和听觉线索,也无法引导患者完成塑造鉴别诊断的体格检查操作。

今天,在《面向实时视频会诊的专家级医疗AI》中,我们介绍了AMIE的实时视频配置版本AMIE(Video),该版本解决了这些限制。基于Gemini和Project Astra构建,AMIE(Video)能够进行同步临床视频会诊,感知非语言临床线索,引导患者演员完成虚拟体格检查,并实时进行诊断推理。在一项包含100种场景、300次实时会诊和30名获得认证的初级保健医生(PCPs)小组的多臂随机研究中,我们首次展示了AI系统在实时临床视频会诊中展现专家级性能。

观看影片

YouTube视频链接

AMIE(视频):异步多代理架构

通过视频进行有效的临床对话需要平衡多重需求:系统必须以自然的对话速度响应患者,同时进行细致的临床推理并持续处理视听流。目前,单一代理无法满足所有这些要求。深度推理需要时间,但对话中的停顿会削弱患者的信任感和默契感。

为解决这一挑战,AMIE(视频)采用异步多代理架构,将工作分配给三个专门代理,这些代理持续并行运行:

  • 对话代理:面向患者的代理驱动响应迅速、低延迟的语音交互。它在保持自然对话流畅性的同时,整合其他代理的指导。
  • 规划代理:在后台运行,该代理持续优化系统的临床推理,更新鉴别诊断和管理计划,识别信息缺口,并重新优先排序多样化的临床目标。
  • 感知代理:该代理持续审查音频和视频流,识别具有临床意义的非语言线索(如可见的痛苦迹象、体格检查发现或听觉信号),并将这些观察结果置于正在进行的对话中进行情境化。

这种解耦设计使AMIE(视频)能够在保持自然对话延迟的同时,执行诊断推理和视听感知,而这些操作否则会导致无法接受的延迟。自动化评估确认,该三代理架构中的每个代理都在提高临床指标方面做出重要贡献,如病史采集能力、临床推理和治疗建议,以及与对话质量相关的指标,包括以患者为中心的沟通技巧和响应延迟。

根据image_width确定适当的宽度

对于移动设备图片,使用默认宽度

AMIE实时临床视频会诊概述、评估研究及关键发现。

通过自动化评估指导开发

构建视听医疗AI的一个关键挑战是大规模表征系统的感知和推理能力。为指导开发,我们从医学文献中提炼出与远程医疗相关的临床视听能力分类法,涵盖非语言视觉线索、听觉信号和体格检查操作。随后,我们围绕这一分类法构建了自动化评估套件。

该评估框架结合了针对性的单轮视听评估与多轮模拟音频咨询。单轮视听评估测试特定的临床感知和推理实例(例如,正确识别解剖学方位或识别呼吸困难迹象)。多轮模拟音频咨询则在注入视觉线索作为文本描述的同时评估端到端对话表现(例如,针对帕金森症场景的AI患者模拟器在提示展示手写时,可能注入口头描述“[将纸张举到摄像头前,展示紧凑、微小的字迹]”)。这些互补性评估共同实现了系统设计的快速迭代,并在人工评估之前对AMIE(视频)的能力和失败模式进行了丰富而详细的表征。

通过随机视频研究进行评估

为了在更具有挑战性和现实性的端到端音视频临床咨询场景中评估临床能力,我们开展了一项大规模随机化客观结构化临床考试(OSCE)研究,采用同步视频咨询界面。

为覆盖评估中广泛的疾病类型,研究涵盖了100个临床场景,涉及五个身体系统,包括心肺、腹部、头/眼/耳/鼻/喉(HEENT)、神经/精神科以及肌肉骨骼疾病。15名受过训练的患者演员在三个研究组中进行了300次标准化咨询:

  • AMIE(视频):AMIE的视频配置,用于进行实时视频咨询。
  • AMIE(文本):仅文本版本,作为基线以隔离音视频功能的贡献。
  • PCP(视频):10名获得认证的初级保健医生(PCPs)通过相同的视频界面进行咨询。

由20名经验丰富的初级保健医生组成的独立评审小组,使用既定的临床评分标准对所有咨询进行了评估,包括通用临床能力量表和针对每个场景定制的详细病例特定评分标准。

通过诊断准确性、临床评估者评分和患者演员偏好来评估AMIE和PCP的视频咨询质量。

关键结果

专家级临床表现:在核心临床能力、病史采集全面性、诊断准确性、管理适当性及沟通质量方面,临床评估者认为AMIE(视频)与PCP表现相当。在这些维度上,AMIE(视频)也与AMIE(文本)持平或更优。

在体格观察和检查方面的优势:AMIE(视频)在引发体征和主动引导患者演员进行虚拟检查操作方面,平均评分显著高于PCP和AMIE(文本)。这一优势也在病例特定的感知和检查评分标准中得到体现。

患者演员更偏好视频体验:患者演员强烈倾向于同步视频界面而非基于文本的聊天,认为其显著更易于使用且更有效地传达健康问题。在共情、建立关系和医疗信心方面,他们对AMIE(视频)的评价也优于PCP和AMIE(文本)。

AMIE视频配置与仅使用文本聊天的AMIE的模态消融对比。结果基于临床评估者的评分和患者演员的偏好。

限制与负责任的开发

这项研究存在重要的局限性,必须在这些局限性的背景下正确解读这些结果。本研究完全使用专业患者演员在模拟临床环境中进行,而非真实患者在自身健康状况下的表现。尽管患者演员技能娴熟,但无法完全复制真实临床互动的复杂性和不可预测性,且场景仅限于可通过表演真实再现的疾病状况,忽略了那些视听感知对诊断具有关键影响的重要临床表现。在研究范围之外,定向自动化评估显示,尽管整体对话质量和诊断准确性较高,系统仍偶尔会出现感知和推理错误,并存在间歇性技术问题可能影响对话自然性。鉴于Project Astra的原型性质,这包含了一些未来开发可能在系统层面解决的技术考量,这些考量超越了本研究中探讨的具体医疗应用。在得出任何关于实际应用价值的结论之前,使用真实患者和真实临床条件进行研究评估是至关重要的下一步。

前景展望

本研究证明,从基于文本的临床AI向视听临床AI的过渡在专家级质量上是可行的。AMIE(视频版)能够感知临床实践的丰富性,观察非语言线索,指导体格检查,并通过口语对话自然交流——这些能力更接近远程医疗视频会诊的实际体验。

在通往负责任的现实世界证据的道路上仍有许多重要问题需要解决。我们的研究结果需要在真实患者中验证,扩展至无法通过表演再现的临床表现,并建立坚实的安全框架。我们已经在这一方向迈出了初步步伐:与Beth Israel Deaconess Medical Center合作进行的真实世界可行性研究,为基于文本的AMIE在临床实践中的安全性和实用性提供了初步证据;我们与Included Health正在进行的全国性随机研究则进一步评估AI在现实世界虚拟护理中的表现。这些研究经验将共同指导如何负责任地将视听能力整合到临床实践中。尽管仍有大量工作要做,但这些结果标志着向能够通过感知临床实践复杂性来增强医疗护理的AI系统迈出了重要的一步。

致谢

本文所述研究是Google Research和Google Deepmind多个团队的联合成果。我们感谢所有合著者——Mahvish Nagda、Jihyeon Lee、Matthew Thompson、CJ Park、Tim Strother、Valentin Liévin、Roma Ruparel、Akshay Goel、Teya Bergamaschi、Suhana Bedi、Meet Shah、Pavel Dubov、Liviu Panait、Toshiyuki Fukuzawa、Sam Schmidgall、Craig Schiff、Joseph Xu、Aliya Rysbek、Yana Lunts、Jan Freyberg、Rebecca Hemenway、Sunny Virmani、David Racz、Carey Radebaugh、Joëlle Barral、Kavi Goel、Dale R. Webster、Katherine Chou、Avinatan Hassidim、Yossi Matias、James Manyika、Gregory Wayne、Tao Tu、Yun Liu、Ethan Goh、Christina Chen、Ryutaro Tanno和Cameron Chen。

  • 标签:
  • 健康与生物科学
  • 机器智能

其他相关文章

  • 2026年7月30日 Science One Framework:基于证据链的可验证自主研究框架 一般科学 · 机器智能 · 自然语言处理
  • 2026年7月22日 SymptomAI:面向日常症状评估的对话式AI代理 一般科学 · 健康与生物科学 · 自然语言处理 · 负责任的AI
  • 2026年7月22日 通过错误学习的量子计算机 机器智能 · 量子计算

×