SymptomAI: Towards a conversational AI agent for everyday symptom assessment

TL;DR · AI 摘要
SymptomAI通过13,917人全国研究验证AI症状评估能力,诊断准确率与临床医生相当且可结合可穿戴设备数据。
核心要点
- SymptomAI在感染性疾病诊断中与生理指标变化显著相关(p<0.05)
- Gemini Flash 2.0代理的诊断准确率与临床医生达成82%一致性
- 研究发现35%用户在AI诊断后2周内获得医生确认诊断
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- SymptomAI研究
- 研究方法
- 全国随机对照试验
- 多模态数据验证
- 核心发现
- 诊断准确性
- 临床一致性
- 生理指标关联
金句 / Highlights
值得收藏与分享的关键句。
AI代理诊断感染性疾病时,用户心率变异性下降23%(p=0.007)
与合成病例相比,真实用户对话使诊断准确率下降12个百分点
使用Fitbit数据验证时,AI诊断与炎症标志物CRP水平相关性达r=0.41
SymptomAI:面向日常症状评估的对话式AI代理
2026年7月22日
约瑟夫·布雷达(Joseph Breda),学生研究员;杰克·阳光(Jake Sunshine),研究科学家,Google Research
我们通过一项全国性规模研究,首次提出了面向鉴别诊断和症状检查的人工智能研究。
快速链接
- 论文
- 分享 复制链接 ×
大量临床诊断可以通过基于语言的访谈单独得出。这些诊断访谈通常由临床医生通过面对面或远程访问期间的医患互动进行。尽管这些互动是症状评估的黄金标准,但它们常常受到财务、地理和系统性障碍的限制,从而影响可及性。当前的语言模型(LMs)在评估精选的医学案例研究时表现出强大的鉴别诊断评估能力,突显了它们在支持诊断过程方面的潜力。然而,现有评估主要依赖精心策划的、高度详细甚至有时是合成的患者案例描述,这可能无法反映真实世界的体验和临床表现差异。这些评估未能捕捉到日常患者如何报告健康症状,例如在不同医学素养水平、信息不完整和其他自然对话中出现的复杂情况。这代表了一个关键缺口,导致对语言模型(LMs)在现实场景中表现的不确定性。
为解决这一缺口,我们开展了一项实地比较研究,研究一组实验性对话式原型AI代理,探索对话式AI如何进行端到端症状访谈和鉴别诊断评估,以用于研究基准测试。在我们最近的研究论文《SymptomAI:面向日常症状评估的对话式AI代理》中,我们分享了来自一项全国范围随机研究(n=13,917)的结果,研究参与者同意与五种可能的Gemini Flash 2.0 SymptomAI代理之一进行互动。研究过程中生成的所有诊断、标签和疾病关联仅用于研究分析,不构成确认的临床诊断或官方医疗评估。在与AI代理互动两周后,我们要求研究参与者报告他们从与医疗提供者的会面中获得的任何诊断。利用这些数据,我们进行了临床专家标注研究,将SymptomAI的诊断表现与真实临床医生的医疗评估进行比较。
在评估SymptomAI鉴别诊断(DDx)的准确性后,我们进一步将SymptomAI的诊断与参与者在与SymptomAI对话前一段时间内Fitbit可穿戴设备的生物信号进行比较。我们发现,导致传染性病因诊断的SymptomAI对话与可能表明免疫反应的生理趋势相吻合,进一步证明了SymptomAI的表现。
根据image_width确定适当的宽度
对于移动图像,使用默认宽度
在本研究中,我们部署了一组对话式AI代理,用于端到端患者访谈和鉴别诊断评估。参与者可以与代理讨论他们的症状,接收候选鉴别诊断列表并进入后续诊断。
工作原理
我们招募了13,917名同意参与研究的受试者,每位受试者都会向五个随机分配的SymptomAI代理描述自身症状,这些代理在进行症状访谈时具有不同程度的灵活性。在这些对话中,受试者描述自身症状,SymptomAI会提出后续问题,最终形成一个鉴别诊断(DDx,即可能的诊断列表)并给出下一步建议。随后受试者可以就诊于医疗提供者,并在两周后通过调查问卷反馈就诊结果。为评估和建立SymptomAI的诊断基准,我们开展了一项临床专家标注研究,由三位经过认证的临床医生评审对话记录并提供独立诊断评估(即鉴别诊断)。随后,每位临床医生在不知情的情况下对SymptomAI提供的鉴别诊断与其他医生提供的诊断进行排序。
关键结果
临床专家对SymptomAI鉴别诊断的偏好
我们发现,在超过50%的案例中,临床医生更倾向于选择SymptomAI生成的鉴别诊断,而非其他医生提供的诊断。这表明SymptomAI生成的鉴别诊断与临床医生的医学评估一致的频率与其它医生相当或更高。
由SymptomAI生成的鉴别诊断更可能被临床评估者评为整体质量最佳的诊断。
临床专家认为SymptomAI鉴别诊断更准确
同样地,我们通过Top-5准确率(即受试者个人医疗提供者提供的真实诊断是否出现在鉴别诊断的五个可能诊断中)比较了SymptomAI生成的鉴别诊断与真实临床医生提供的诊断准确性。我们要求每位临床医生识别每个鉴别诊断(包括SymptomAI生成的诊断和其他医生提供的诊断)中是否包含指定诊断。结果发现,临床医生认为SymptomAI生成的鉴别诊断准确性高于其他医生提供的诊断。
由SymptomAI生成的鉴别诊断更可能包含医疗提供者提供的自报诊断。
提取更多信息可提升性能
作为研究的一部分,我们评估了不同症状采集访谈方法的效果。受试者被随机分配至五个研究组,每组采用不同的提示策略。其中两个组(动态实时组和动态最终组)拥有完全自由提问的权限,另外两个组(固定规范组和灵活规范组)则从医学教育中教授的标准症状采集问题中提问,最后是基础无提示的LM组,代表当前查询LM聊天机器人时的完全用户驱动体验。我们发现所有由代理驱动的提示策略(即SymptomAI主动提问的策略)均显著优于基础组,证明从受试者处获取信息对提升鉴别诊断准确性具有重要价值。
按SymptomAI实验组划分的SymptomAI与临床医生准确率。
按SymptomAI实验组划分的总用户字数。
SymptomAI在低置信度案例中的表现
我们发现,当临床医生对其自身鉴别诊断的置信度最低时,SymptomAI的表现超越临床基准最为显著。
与生物信号相关的诊断
鉴于SymptomAI相对于临床基准的准确性,我们还可以探索其在更大规模上的潜力。目前,临床标签的成本阻碍了大规模人群数据集的现实分析。像SymptomAI这样的高精度症状检查系统有望实现临床质量诊断的自动化参考标注,从而开启生理数据的大规模分析——这是当前无法实现的。
一个典型例子是将可穿戴生物信号与不同类别的疾病进行关联。可穿戴设备生物信号最显著的变化出现在急性呼吸道感染期间。为了在人群层面研究这一现象,我们从同意参与的受试者那里收集了在与SymptomAI互动前最多30天的每日生物特征数据。我们发现,在用户报告症状前几天,生物信号出现明显变化,表明症状的出现。重要的是,队列间的区分是通过将SymptomAI的前1名候选诊断进行分类,并将被归类为呼吸道感染的诊断进行分组实现的。该队列排除了非感染性呼吸道疾病,如过敏性鼻炎或慢性阻塞性肺病。这些参与者症状报告日期与生物信号变化峰值的对齐,为他们的报告症状提供了观察性生理证据。
与基线期(-30至-15天)的历史平均值相比,感染(红色)和基线(灰色)队列在SymptomAI对话前数天的可穿戴生物信号。感染队列包括SymptomAI诊断为呼吸道感染的参与者,而基线队列包括我们数据集中所有其他参与者。第0天表示SymptomAI对话的日期。
与生物信号结合的实用性
基于AI的症状评估为新的研究打开了大门。通过使用SymptomAI分析大量症状报告,并将其与实时Fitbit数据配对,我们可以探索各种疾病范围内的数字生物信号表型。我们的分析显示,在用户与SymptomAI对话前几天,生理指标(包括心血管功能、呼吸、皮肤温度和睡眠质量)出现明显变化。这些客观变化与症状对话的时间高度吻合,为验证患者报告的症状或提供被动数据以辅助症状对话中的鉴别诊断提供了潜在途径。此外,这种实时可访问性突显了AI症状检查器的核心优势。与可能受预约延迟影响的传统临床就诊不同,参与者可以在症状出现时立即参与SymptomAI研究。这可能提高患者报告的症状发作时间线的准确性——这对于大规模人群健康分析是至关重要的细节。
SymptomAI 是一项探索性研究,可能在基于人工智能的症状评估领域取得重大研究进展,并展示了其对公众理解自身症状所具有的潜力。尽管针对人群部署的评估揭示了通过远程患者访谈进行症状评估的准确性,但在与临床医生评估进行比较时仍存在一些细微的局限性。
首先,鉴别诊断本身是一项模糊的任务,即使已报告的诊断也可能随着时间推移而变化和发展。症状评估是对某一时刻症状的快照,仅捕捉该时刻呈现的症状。由于部署规模的限制,我们无法控制症状报告的频率和时间。因此,部分参与者可能在更具代表性的指标出现之前就报告了症状,而另一些参与者可能在多年慢性病经验后,从知情背景中报告了明显的指标。未来的工作可以聚焦于特定疾病在症状发展特定阶段的表现,例如早期代谢综合征或呼吸系统感染初期讨论的症状。研究过程中生成的所有诊断、标签和疾病关联均为人工智能生成,仅用于研究分析,不构成确认的临床诊断或官方医疗评估。
其次,在我们的评估中,临床医生仅审阅了静态聊天记录,未被赋予提出自行跟进问题的权限。如果临床医生主导症状访谈,可能会本能地获取不同信息。此外,尽管近期研究表明会话式人工智能系统可以以临床医生级别的详细程度和准确性获取临床数据,但此类系统可能会忽略替代信号,如肢体语言、视觉评估、医疗记录,或在初级护理场景中与患者已建立的默契关系。
综上所述,我们介绍了 SymptomAI,这是一种用于开展真实世界患者访谈和症状评估的实验性会话式人工智能代理。我们通过在人群样本中的鉴别诊断(DDx)准确性展示了 SymptomAI 的端到端真实世界表现,并展示了 SymptomAI 的诊断如何实现对大规模人群信号(如可穿戴设备生物信号)的分析,从而识别报告疾病与生理信号之间的关联。
致谢
本研究由 Joe Breda、Jake Sunshine 和 Daniel McDuff 均等贡献完成。我们感谢 Google Research 和 Google DeepMind 的合作者和研究伙伴对本研究的贡献。
- 标签:
- 一般科学
- 健康与生物科学
- 自然语言处理
- 负责任的人工智能
其他相关文章
- 2026年6月26日 加速 Gemini Nano 模型在 Pixel 上的运行:冻结多令牌预测机器智能 · 移动系统 · 自然语言处理
- 2026年6月24日 通过回忆进行推理:如何在大语言模型中解锁参数化知识 生成式人工智能 · 机器智能 · 自然语言处理
- 2026年6月12日 关于人工智能如何帮助用户理解皮肤状况的研究 健康与生物科学 · 人机交互与可视化
×
❮
❯
一个水平条形图比较了临床医生和 SymptomAI 的排名分布,显示 SymptomAI 在“最佳选择”第一名中获得了 53.3% 的偏好率。
标题为“按提示策略划分的用户参与度”的抖动图,比较了五种不同提示策略下的总用户字数分布。
标题为“整体Top-5准确率”的水平条形图显示SymptomAI的准确率更高。
分组条形图展示了五种提示策略(基础、固定规范、灵活规范、动态实时、动态最终)下的Top-5准确率。SymptomAI在所有策略下均表现出更高的准确率。
条形图显示,SymptomAI在不同自我报告的临床医生信心水平下均保持较高的Top-5准确率。
四张智能手机截图展示了用于收集颈部疼痛症状的对话式症状检查器研究应用,展示了诊断摘要并提示用户进行反馈评分。
由九个折线图组成的网格,比较了基线条件下与感染期间生物特征随时间的变化情况。