GlucoFM: Foundation model for continuous glucose monitoring

TL;DR · AI 摘要
GlucoFM通过双流设计实现持续血糖监测,跨任务性能提升5.8个百分点,MAE低于竞品模型。
核心要点
- GlucoFM的PR-AUC比GluFormer高5.8个百分点
- 双流设计分离慢趋势与短期偏差提升模型表现
- 在PPGR预测中MAE低于Dexcom和Libre设备
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GlucoFM模型
- 双流架构
- 慢趋势流
- 短期偏差流
- 实验成果
- 7任务PR-AUC提升
- PPGR MAE最低
- 应用场景
- 糖尿病风险评估
- 胰岛素抵抗预测
金句 / Highlights
值得收藏与分享的关键句。
GlucoFM的PR-AUC比GluFormer高5.8个百分点
双流设计分离慢趋势与短期偏差提升模型表现
在PPGR预测中MAE低于Dexcom和Libre设备
GlucoFM:连续血糖监测的基础模型
2026年8月26日
Ahmed A. Metwally,研究员,Zechen Li,学生研究员,Google Research
GlucoFM是一种轻量级的自监督CGM基础模型,通过分离的流分别建模较慢的血糖趋势和短期偏差,生成可迁移的表示,并在包括糖尿病风险评估、胰岛素抵抗、β细胞功能障碍和餐后血糖反应在内的多种代谢预测任务中设立了新的性能标准。
快速链接
- 论文
- 分享 复制链接 ×
消费级可穿戴设备使用运动和生理传感器来估计活动和睡眠,但这些信号仅能提供对血糖调节的间接视图。连续血糖监测仪(CGM)通过皮下插入的小型传感器每几分钟跟踪间质葡萄糖,补充这些测量值,捕捉空腹、夜间和餐后模式。然而,理解这些轨迹仍然具有挑战性,尤其是在高质量临床标签稀少且获取成本高昂的情况下。
许多现有的CGM基础模型——包括CGMformer、GluFormer和CGM-JEPA——通过单一表示流处理血糖,而不是明确区分缓慢基线和瞬态事件动态。但CGM并非单一的数据流:它包含相对缓慢的基线模式,这些模式被可能反映餐食、活动或传感器伪影的短期偏差所打断。如果我们能利用日常CGM数据,仅使用有限的标记数据来估计糖尿病风险、胰岛素抵抗和β细胞功能障碍等指标会怎样?
这就是我们构建GlucoFM的原因——一个具有双流设计的自监督基础模型,该模型在保留时间-of-天和缺失性的同时,将较慢的血糖趋势与短期偏差分离。随后,潜在预测目标学习它们的日常上下文和时间演变。我们在四个多样化的队列上对GlucoFM进行了评估,涉及七个临床预测任务——糖尿病风险、胰岛素抵抗、β细胞功能障碍、高脂血症、低血糖、肥胖和血糖类型——共计14个队列-任务评估。在这些评估中,GlucoFM的PR-AUC平均比在相同语料库上预训练的最佳GluFormer变体高出5.8个百分点。在PR-AUC指标上,GlucoFM在所有糖尿病风险和β细胞功能障碍评估中均领先,并在四个胰岛素抵抗评估中的三个中表现最佳。我们还对GlucoFM在餐后血糖反应(PPGR)预测进行了评估。在匹配输入和评估协议的情况下,GlucoFM在两种CGM设备(Dexcom和Libre)上实现了最低的平均绝对误差(MAE)。此外,GlucoFM在跨数据集迁移性能方面表现最佳,并展示了强大的少样本适应能力,即使新队列或标记受试者的数据极其有限。
根据image_width确定适当的宽度
对于移动图像,使用默认宽度
GlucoFM概述:一种轻量级双流基础模型用于连续血糖监测。
训练GlucoFM以理解代谢
我们在来自Wear-CGM [8e73d8]和四个已发表数据集的109,066小时未标记CGM数据上预训练了GlucoFM,总计477个参与者/会话记录。
CGM记录可能包含数据缺口、不同的采样间隔和传感器伪影。GlucoFM将每条记录对齐到24小时、五分钟的时间网格,并保留观测掩码,使已测量和未观测的位置保持区分。其双流编码器将低频状态分量(代表较慢的血糖趋势)与残差事件分量(捕捉可能由生理、行为或传感伪影引起的短期偏差)分离。
GlucoFM不重建受测量噪声和传感器伪影影响的原始血糖读数,而是采用潜在预测预训练的两个互补任务:
- 上下文预测:我们对每日血糖序列的部分进行掩码(即隐藏),并要求模型从周围上下文中预测其潜在表示。通过在潜在空间进行预测,模型能够捕捉更广泛的日常血糖模式,而无需重建每个传感器读数。
- 时间动态:我们还训练模型预测一个人的稳定基线和短期偏差如何从一小时到下一小时发生变化。这促使模型捕捉血糖动态的连续性,而非将读数视为时间中的孤立快照。
最后,CGM感知增强引入了基线漂移、类似压缩的下降、采样稀疏性和短暂断开,使模型暴露于真实CGM记录中遇到的变异性和缺失数据。
GlucoFM的模型框架和预训练目标。
GlucoFM的功能
我们在四个队列(CGMacros、Stanford、Hall和ShanghaiT2DM)和七个临床预测任务上评估了GlucoFM,并单独评估了两小时餐后血糖反应预测。具体而言,我们检验了其冻结表示是否能为未见参与者的单日24小时窗口提供信息;是否能为预测餐后血糖轨迹提供有用的的历史背景;结合多天数据是否能提升个体预测效果;表示在新队列中的迁移效果如何;以及在标记数据有限时的适应能力如何。
代谢任务的准确性
首先,我们使用了受试者独立的窗口级线性探测。我们冻结每个模型的编码器,在单日24小时表示上训练线性分类器,并确保没有任何参与者同时出现在训练和测试折叠中。这检验了单日表示是否对未见参与者具有表型信息性,同时保留日常变化性。
GlucoFM在评估方法中实现了最强的任务平均PR-AUC。在14个队列-任务评估中,它将最强CGM特定基线(在相同数据上重新训练)的平均PR-AUC从54.7提升至58.8——绝对增长4.1点,相当于该基线的约7.5%相对提升。GlucoFM在所有糖尿病风险和β细胞功能障碍评估中均取得最高PR-AUC,并在四个胰岛素抵抗评估中的三个中取得最高值。
代谢表型线性探测性能。
预测餐后血糖反应
为了在动态预测任务上测试GlucoFM,我们利用每次记录餐食前可获取的信息,预测相对于餐食开始值的完整两小时血糖变化轨迹。我们使用34名受试者的874对餐食事件数据进行评估,采用受试者独立交叉验证方法,Dexcom和Libre(两种CGM设备)在相同数据划分下分别建模。
我们逐步将每个冻结模型表示与一小时餐前CGM数据、餐食营养信息(包括能量、碳水化合物、脂肪、蛋白质和膳食纤维)以及受试者层面信息(如空腹血糖、BMI和糖尿病状态)进行融合。在完整上下文支持下,GlucoFM在评估模型中实现了最低的平均MAE:21.88 mg/dL,优于最佳基线模型的22.90 mg/dL和训练集均值基线的27.69 mg/dL。这些结果表明,GlucoFM为预测餐后血糖变化提供了互补的历史上下文信息。
渐进式上下文增强两小时完整轨迹的餐后血糖响应预测。从每个冻结模型表示开始,逐步添加输入:1小时餐前CGM数据、餐食营养信息、空腹血糖以及BMI和糖尿病状态。平均MAE(mg/dL;数值越低越好)是基于Dexcom和Libre配对评估的平均值。
超越单日数据
单日24小时血糖轨迹可能无法完全反映个体的血糖模式,因此我们测试了多日数据融合对受试者层面预测的提升效果。GlucoFM对每一天进行独立编码,并在最多七天内对表示进行平均,每位受试者的贡献度相同。
如下面的图表所示,增加观察天数在多数数据集的多数场景中均提升了PR-AUC指标,包括斯坦福β细胞功能障碍任务提升了9.6个点,Hall糖尿病预测任务提升了14.0个点。CGMacros在Dexcom、Libre和融合传感器数据上也表现出主要正向提升。上海T2DM胰岛素抵抗是简单平均下的主要例外情况,表明最佳聚合策略可能因任务而异。总体而言,GlucoFM的每日冻结表示可以在无需重新训练编码器的情况下组合使用,以增强受试者层面的预测能力。
𝐾日CGM观测的影响。正值表示相比𝐾=1时的改进。
跨队列泛化能力
接下来,我们想验证模型学习的生理模式是否具有泛化能力。如果使用一个临床队列的数据训练下游分类器检测糖尿病风险,它是否仍能适用于完全不同的研究中的患者?跨数据集迁移的条形图突显了GlucoFM如何应对这一挑战,特别绘制了其在糖尿病风险和胰岛素抵抗预测任务中对第二佳模型的直接提升效果。
在下图中,正向条形表示GlucoFM优于最强竞争方法:在12项评估中11项领先0.5-8.6个PR-AUC点,仅在一项评估中落后0.6个点。其绝对PR-AUC范围从斯坦福到Hall任务的61.6%到Hall到CGMacros胰岛素抵抗的90.0%,表明对基础生理机制的关注使冻结表示能够超越队列特异性噪声,发现通用代谢模式。
跨数据集迁移性能。GlucoFM与最强基线之间的ΔPR-AUC差异。
在数据量较少情况下的学习能力
带标签的临床数据获取成本高昂,因此我们还在两种少量样本设置下对GlucoFM进行了测试:左侧图表按类别调整每个参与者的标签数量,右侧图表则调整每个参与者可用观测值的比例。向右移动表示增加了标签数据,更高的点位表明任务平均PR-AUC表现更优。
橙色GlucoFM标记在所有评估的数据预算下均表现最佳,包括每类仅1个样本和每个参与者仅1%观测值的极端情况。当标签样本稀缺时,这种优势尤为明显,表明该模型即使在仅有少量示例的情况下也能高效捕捉关键信号。
在标签样本有限且每个参与者观测值有限的少量样本适应场景。
在两个时间尺度上建模血糖动态
我们还仔细检验了将信号拆分为双流是否确实带来差异。我们将完整的双流设计与更简单的替代方案进行了对比:一种直接处理原始血糖数据的方案,一种强调慢速趋势的方案,以及一种强调快速短期波动的方案。
正如我们的编码器设计分析所示,"仅事件"版本表现最弱,证明仅依赖瞬时波动无法构建稳定的代谢图景。虽然原始输入和"仅状态"版本具有一定竞争力,但完整的双流模型始终表现最佳。这些结果支持将慢速和快速血糖动态作为互补流进行建模后再融合,而非依赖单一时间尺度的流。
双流与单流设计的性能对比。
结论
我们的研究结果表明,持续血糖监测(CGM)模型通过显式考虑血糖动态的多尺度特性(包括慢速趋势、短期波动、每日时间规律和传感器缺失情况)可以获益。GlucoFM通过从未标记CGM数据中学习可复用模式,在评估的预测、迁移和少量样本场景中均表现出色,为更高效利用有限的标签临床数据提供了可行路径。
代谢反应在个体、群体和传感器设备间存在差异,而我们当前的预训练人群规模仍较为有限。下一步计划是在更大更多元的人群上进行训练,将GlucoFM从独立处理的24小时窗口扩展到原生多日建模,以捕捉持续数周或数月的趋势,并探索这些表征如何处理实时变化。关于代谢健康仍有大量未知领域,我们期待这些工具能引领我们发现更多突破。
致谢
以下研究人员对本研究做出了贡献:李泽辰、纳塔拉詹·基尔特哈纳、张伟之、Lee Simon A、张宇伟、Xu Maxwell A、周梦莲、Esmaeilpour Zeinab、Salim Flora D(新南威尔士大学)、Malhotra Mark、Sunden Lindsey、Patel Shwetak、Yang Yuzhe、Metwally Ahmed A。
我们衷心感谢Bobak J. Mortazavi和Ricardo Gutierrez-Osuna(德克萨斯A&M大学)提供了本研究使用的CGMacros数据集。
- 标签:
- 健康与生物科学
- 机器智能
- 两项Wear-CGM研究已获得Advarra伦理审查委员会批准(IRB编号Pro00059582和Pro00069880),参与者已书面同意用于去标识化二次研究和算法开发。已发布数据集均按照各自伦理审批和知情同意程序收集。
其他相关文章
- 2026年8月31日 TimesFM-3:面向多变量预测的零样本基础模型 数据管理 · 机器智能 · 产品
- 2026年8月27日 行星预测引擎:通过地球AI实现全球模型自动化 地球AI · 生成式AI · 机器智能
- 2026年8月25日 AgentHands:为XR空间锚定代理对话生成交互手势 人机交互与可视化 · 机器智能
×
❮
❯
比较输入方法的条形图,显示所提出的双流方法在三个不同指标上均取得最高平均分。
GlucoFM模型架构示意图,展示流嵌入、Transformer编码器和时间动态建模模块。
两张条形图展示GlucoFM在少样本学习场景下,相比竞争模型在PR-AUC指标上保持更优的平均表现。
折线图显示随着渐进式上下文变量增加,GlucoFM实现最低的平均绝对误差。
条形图突出显示模型在不同队列数据集之间零样本迁移场景下的性能提升百分比。
GlucoFM框架概览图,详细说明数据预处理、JEPA风格预训练架构和临床预测应用模块。
六组临床数据集在多日时间间隔下PR-AUC指标提升的条形图对比。
代谢健康评估六大类别的线性探针雷达图,显示GlucoFM在四个基线模型上的全面性能优势。