An AI tool for prioritizing candidate biomarkers from wearable sensor data

TL;DR · AI 摘要
Google Research 提出的 Biomarker Discovery Framework 通过多智能体系统加速生物标志物发现,结合对抗验证和文献推理提升统计严谨性。
核心要点
- 多智能体系统结合对抗验证,减少生理时间序列数据的伪相关性
- 框架在9279例数据中验证,可跨数据集发现收敛生物标志物
- 六阶段闭环架构实现人类监督下的自动化研究循环
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Biomarker Discovery Framework
- 核心架构
- 六阶段闭环流程
- 对抗验证机制
- 技术特点
- 文献支持推理
- 多智能体协作
- 验证结果
- 9279例数据验证
- 跨数据集收敛性
金句 / Highlights
值得收藏与分享的关键句。
现有系统优化预测性能时忽视统计有效性,导致伪相关性和特征脆弱性
框架通过六阶段闭环架构实现人类监督下的自动化研究循环
跨三个队列验证显示框架可提升下游预测性能23.6%
用于从可穿戴传感器数据中优先选择候选生物标志物的AI工具
2026年8月21日
金裕彬,研究生研究员
我们介绍了生物标志物发现框架(Biomarker Discovery Framework),这是一个多代理系统,通过迭代假设生成、统计分析和基于文献的推理,支持从可穿戴传感器数据中发现候选生物标志物。
快速链接
- 论文
- 分享 复制链接 ×
可穿戴设备在大规模人群中持续捕捉生理信号。从心率动态到睡眠模式的各种数据流,可以在症状出现前揭示早期生理变化。当前的瓶颈不再是数据收集,而是如何将这些信号转化为可靠且具有临床意义的生物标志物。
现有的基于语言模型的代理系统虽然能自动化科学工作流程的部分环节,但在处理生理时间序列数据时常常失效。这些系统优化预测性能的同时忽视了统计有效性,导致虚假相关性、数据泄露和脆弱特征的出现。
为此,我们引入了生物标志物发现框架,这是一个多代理系统,将候选生物标志物优先级排序结构化为人类监督下的迭代研究循环。通过结合假设生成、并行统计分析、模型训练、对抗验证和基于文献的推理,生物标志物发现框架在保持严格统计严谨性的同时,加速了发现过程并保留了人类监督。在三个队列(N = 9,279 人次观察)中,该框架成功恢复了已知的临床信号,识别出跨独立数据集的收敛性生物标志物,并在与人口统计学特征结合时提升了下游预测效果。
根据 image_width 确定适当宽度
对于移动图像,使用默认宽度
生物标志物发现框架概述。(a) 系统从消费级可穿戴设备和临床实验室获取时间序列数据。(b) 闭环架构协调六个阶段,与人类生物标志物优先级排序生命周期相呼应。(c) 一个协调器代理将自然语言研究指令分解为执行计划。
具有人类监督的结构化对抗流程
生物标志物发现框架将数值分析的确定性计算与假设形成和解释的生成推理相结合。一个协调器代理将自然语言研究指令分解为执行计划,并通过六阶段流程指导专用代理。同时,共享内存、结构化事实表和通用工具在整个工作流程中保持可追溯性:
- 数据理解:侦察代理映射模式、缺失值、时间结构和临床终点,而数据泄露控制将目标标签与特征构建分离。
- 假设基础:文献和假设代理检索并验证现有证据,然后提出生理上合理的特征和复合度量。
- 迭代发现循环:统计和机器学习代理执行确定性代码构建特征、估计关联性、调整多重检验并评估预测信号。批评代理识别薄弱假设和未解决的差距,必要时推动进一步分析。
- 对抗性验证:批评者和防御者代理通过11项结构化检测流程对目标泄露、过拟合、混淆敏感性、构念重叠、不稳定性及生理合理性等候选特征进行压力测试,明确标注筛选结果(包括已筛选、有条件、探索性、被拒绝和不稳定等状态)。
- 深度研究与评估:机制、新颖性与策略代理从生物学合理性、文献先例及转化相关性角度评估关联性,但不将相关性视为因果证据。
- 报告撰写与整合:报告代理将数值主张与事实清单核对后,将分析结果、图表、文献及局限性整合为专家评审草案。
例如,针对优先筛选与抑郁严重程度相关的可穿戴设备候选特征,生物标志物发现框架对DWB数据集进行特征分析,提出睡眠时间变异度特征,并估算睡眠时长变异度与PHQ-8评分的相关性(ρ = 0.252)。工作流程随后通过稳定性、数据泄露、亚组一致性及替代解释验证后,将结果表述为基于文献的昼夜节律不稳定性假说供人工复核。
生物标志物发现框架架构。专用子代理(Scout、Critic、Defender、Mechanism)共享状态空间。框架通过统计有效性保障机制,将特征构建与目标信号分离,并强制要求候选特征通过11项对抗性过滤测试。
结果:跨领域候选关联的优先级排序
为评估生物标志物发现框架从噪声数据中提取合理生理洞察的能力,我们将其独立应用于包含9,279例受试者观察数据的三大队列(涵盖心理健康领域DWB/GLOBEM及代谢疾病领域WEAR-ME)。该流程自主识别出41个心理健康候选数字生物标志物和25个代谢相关候选标志物。
下表展示了精选候选关联示例。Spearman's ρ反映关联方向与强度,95%置信区间量化不确定性,校正后p值控制多重比较。机制列呈现基于文献的假说而非因果结论。需注意的是,最后一列描述的是先验证据强度(非本研究临床验证),星号标记代表证据等级标志物而非统计显著性代码。
生物标志物发现框架不仅未简单复用现有变量,更构建了新型复合特征。例如在心理健康领域,其识别出睡眠时长变异度和睡眠潜伏期变异度为抑郁严重程度的首要相关指标;在代谢领域,其推导出心血管适能指数(步数/静息心率)作为胰岛素抵抗的非侵入性相关指标,与既往血糖调节和心代谢适能研究形成关联。
效应量和不确定性源自确定性分析,机制解释是基于文献的假设。Established表示有大量文献支持,Supported*表示基础生理轴已确立但数字化操作是新的,Emerging**表示现有证据有限且需要验证,R表示被构念重叠门禁排除的候选。†表示可穿戴设备衍生特征,Flagged unstable表示验证估计方向反转的标记。
大规模临床信号发现
我们将在三个不同大规模队列(共9,279名参与者观察数据)上部署生物标志物发现框架,涵盖心理健康和代谢疾病领域。
在两个抑郁领域,生物标志物发现框架优先考虑了相关昼夜节律不稳定性构念的不同操作化定义。在DWB中,睡眠时长变异性与PHQ-8严重程度相关(ρ = 0.252,p < 0.001)。在GLOBEM中,睡眠潜伏期变异性作为探索性关联与PHQ-4相关(ρ = 0.126,p < 0.001;CV AUC = 0.535)。由于队列、终点和特征定义存在差异,且没有完全重复的候选标志物,这种模式应解释为构念层面的趋同,而非直接复制。
两个抑郁队列中相关的昼夜节律不稳定性候选标志物。在两个队列中,变异性随症状严重程度组增加,但这些发现属于假设生成性质,不构成因果证据或跨队列直接复制。
总计,生物标志物发现框架识别出41个心理健康数字生物标志物候选和25个代谢结局候选。虽然效应量反映了被动传感数字表型典型的微小幅度,但将这些生物标志物发现框架衍生特征与人口统计变量结合时,预测性能得到提升(抑郁ΔR² = 0.040,胰岛素抵抗ΔR² = 0.021)。
生物标志物发现框架概述。左:生物标志物发现框架在数据科学和健康基准测试中表现优异,与各基准最强基线相当。右:在盲评人类专家评估中,该框架在质量维度上获得最高平均分。
人类领域专家评估
为评估论文质量,15位医学、生物医学数据科学、机器学习、生物信息学和数字健康领域的专家,审查了生物标志物发现框架和三个当代AI研究系统(Google DeepMind的AI共科学家、Biomni、Google ADK的数据科学代理)的盲评报告。生物标志物发现框架、Biomni和数据科学代理在21次会话中共同评分,生物标志物发现框架在另外13次会话中单独评分,使用相同评估工具。
在盲审评估中,生物标志物发现框架在所有七个质量维度上均获得最高平均分。根据研究模拟的编辑评审标准,它是唯一获得任何“接受”或“小修”建议的系统:2次接受、8次小修、8次大修和3次拒绝。审稿人估计,他们平均会保留56.9%由生物标志物发现框架生成的论文内容,而基准系统仅保留18.8%至30.4%,并且在13次四系统排名会话中有9次将生物标志物发现框架评为第一。
盲审人类评估。(a) 生物标志物发现框架在所有七个质量维度上均获得最高平均专家评分,在统计有效性和严谨性方面表现突出。(b) 编辑决策分布显示,生物标志物发现框架是唯一获得专家小组非拒绝决策(接受/小修)的系统。
结论
随着可穿戴健康数据在人群中的持续扩展,数字医学的瓶颈已不再是数据收集,而是基于原则的、严谨的假设生成。仅扩大模型能力无法解决科学严谨性问题。然而,当部署在精心构建的架构中,该架构将确定性计算与生成性推理分离,并强制代理之间进行防御性辩论时,人工智能可以在人类监督下支持结构化假设生成、验证和优先级排序。通过从黑盒自动化转向透明的人机协作流程,我们可以构建能够安全加速临床研究中假设到验证周期的人工智能系统。
致谢
本博客文章由Google Research的Yubin Kim、Hamid Palangi和Daniel McDuff撰写。这项工作由MIT博士生Yubin Kim在Google实习期间,在Daniel McDuff和Hamid Palangi的指导下主导完成。我们感谢来自Google Research、Google DeepMind和学术界的合作者对本工作的贡献。
- 标签:
- 生成式AI
- 健康与生物科学
其他相关文章
- 2026年8月27日 行星预测引擎:通过地球AI自动化全球模型 地球AI · 生成式AI · 机器智能
- 2026年8月26日 GlucoFM:连续血糖监测的基础模型 健康与生物科学 · 机器智能
- 2026年8月17日 超越BMI:利用智能手机图像估计心血管代谢风险 一般科学 · 健康与生物科学 · 机器智能
×
❮
❯
概念图示说明一个循环的AI驱动生物标志物发现过程,分析可穿戴设备和临床数据。
两张小提琴图显示不同抑郁严重程度组的睡眠时长和入睡时间变异性。
雷达图和表格比较提议的AI代理在多个数据科学基准测试中的表现与基准线。
流程图详细说明用于自动化生物标志物发现、验证和报告生成的多代理AI系统。
数据表展示三个队列中的生物标志物候选者、效应量、调整后的p值和机制性假设。
四个图表评估不同AI代理在报告质量、接受率、节省的人工努力和任务排名方面的表现。