Google Research 发布 GlucoFM,一个轻量级 CGM 基础模型,把血糖曲线分离为慢速基线趋势与短时波动两条流进行自监督学习。在四个队列、七项临床预测任务中,其 PR-AUC 平均比最强的 CGM 专用基线高出 4.1 个百分点,并能以极少量标注数据预测糖尿病风险、胰岛素抵抗等代谢指标。

想象一位调音师在制作歌曲混音:他不会把整首歌当成一条音轨来处理,而是先把人声和伴奏拆开,再分别调整节奏组与旋律组——低音线负责平稳的底子,打击乐负责突发的节拍。这样哪段抢拍、哪段走音,一目了然。GlucoFM 做的正是类似的事:它把血糖曲线拆成“慢趋势”和“短波动”两条流,让模型分别学习日常节律与事件性变化,再在潜在空间里预测被遮住的片段与下一小时的演变,而不是死记硬背每个读数。这样一来,模型不必依赖大量昂贵的临床标注,也能读懂血糖数据里的代谢信号。类比到此为止,实际差别是:调音师拆轨是为了让声音更好听,而 GlucoFM 拆流是为了让机器从无标注的连续血糖数据中学会预测糖尿病风险、β细胞功能障碍等健康结局。
事件

一条血糖曲线,拆成两条流

2026年8月26日,Google Research与UNSW Sydney联合发布GlucoFM,一款自监督基础模型(在大规模数据上预训练,可适配多种任务)。它把连续血糖监测数据拆成两条独立流——慢速生理趋势和短期波动——分别建模。

GlucoFM的核心设计是双流编码器。一条处理低频状态分量,代表血糖的缓慢基线变化;另一条处理残差事件分量,捕捉餐后、运动或传感器伪影造成的短时偏差。输入对齐到24小时、5分钟网格,并保留观测掩码,让模型知道哪些时间点有真实数据。这种结构与现有CGM模型不同:CGMformer、GluFormer、CGM-JEPA均把血糖序列当作单一流处理,未显式分离快慢成分。

评估结果来自4个队列、7项临床任务,共14项队列-任务组合。GlucoFM的平均PR-AUC比同一预训练语料下重训的最强 CGM 专用基线高出4.1个百分点(54.7→58.8,相对约+7.5%)。在糖尿病风险评估和β细胞功能障碍判断上,它全部领先;胰岛素抵抗评估中,4项里领先3项。评测还覆盖高脂血症、低血糖、肥胖和糖型(glucotype)分类。目前该项目为研究阶段,权重尚未公开。

机制

CGM 数据不是均匀的,它拆成两条流来学

GlucoFM 的核心理念很简单:血糖曲线里的慢趋势和短波动,不应该被塞进同一个通道里处理。

连续血糖监测仪每几分钟记录一次组织间液葡萄糖浓度,CGM(连续血糖监测,通过皮下传感器每几分钟记录一次血糖值)。

但这条曲线不是均匀的——它包含缓慢变化的基线(比如空腹和夜间模式)和快速波动的偏差(来自吃饭、运动或传感器噪点)。此前的主流模型,包括 CGMformer、GluFormer 和 CGM-JEPA,都用一个单流编码器处理整个序列。

Google Research 和 UNSW Sydney 的研究者觉得这不对:基线模式和事件模式是两种不同生理信号,混在一起学,互相干扰。

GlucoFM 把一条 CGM 轨迹分解成两条流:一条捕捉慢速生理“状态”,另一条捕捉瞬时“事件”。两条流都保留时间戳和缺失标记,然后分别用两套 JEPA 风格的目标函数做自监督学习预训练(一种训练方法,让模型从数据本身的结构中学习,无需人工标注标签)。这样一来,模型在预训练阶段就学会了区分“这个人的空腹血糖基线是多少”和“刚才那顿饭引起了多大波动”。

Ⅰ
训练数据规模
109,066 小时未标记 CGM 数据,来自 Wear-CGM 和四个公开数据集,共 477 条参与者/会话记录。
(来源:Google Research 论文,2026-08-26)
Ⅱ
参数量
0.72M 可训练参数(据行业媒体 Agent5 报道;官方博客未披露参数量)。
(来源:Agent5,2026-08-27)
Ⅲ
性能提升
14 项评估平均 PR-AUC 达 58.8,最强基线 54.7,绝对提升 4.1 个百分点(相对约 +7.5%)。
(来源:Google Research 论文,2026-08-26)

双流设计的直接好处是:模型对标注数据的需求降低。传统方法要预测糖尿病风险或胰岛素抵抗,通常需要大量临床标注的 CGM 记录。GlucoFM 先用前文提到的那批未标注数据预训练,然后只用少量标注样本微调(在预训练好的模型基础上,用小量特定任务数据做进一步训练,让它适应新任务)就能迁移到新任务。Google 在论文中报告,GlucoFM 在糖尿病风险评估、胰岛素抵抗、β细胞功能障碍等 7 项临床预测任务上,达到了前文提到的性能提升。

关键在于,GlucoFM 并没有用更大的模型来赢得优势——据行业媒体 Agent5 报道,它的编码器参数只有 0.72M。官方博客未披露参数量,也没有公开完整权重,更没有第三方复测结果。双流策略是否在所有场景下都优于单流,还需要独立验证。

反直觉

轻量设计,凭什么赢?

Google Research 发布的 GlucoFM,在 14 项队列-任务评估上,平均 PR-AUC(精确率-召回率曲线下面积,衡量预测排序质量)比最强的 CGM 专用基线高 4.1 个百分点。它有多大?据 Agent5 报道,只有 0.72M 个可训练参数。

过去处理连续血糖监测(CGM)数据的基础模型(在大规模数据上预训练、可适配多种任务的通用模型),都把整条血糖曲线当作一条流来学。GlucoFM 偏不:它用自监督(不用人工标注,自己从数据里找规律)预训练,把曲线拆成两条流——一条慢速的生理“状态”,一条短暂的“事件”波动。拆开之后,每条流只需学会一个更简单的任务。

拆开没丢信息,反而赢了。四个队列、七项临床任务上,GlucoFM 的 PR-AUC 平均比最强基线高 4.1 个百分点。糖尿病风险和 β 细胞功能障碍的所有评估,它都排第一;胰岛素抵抗的四项评估中它赢了三项。

关键 拆对数据结构,可能比堆参数更值钱。

据行业媒体报道,0.72M 参数对基础模型来说小得反常。它能赢,很可能靠的是双流结构把问题拆成两个更简单的子问题:一条流学“今天血糖的底色”,另一条流学“刚才发生了什么”。

跨设备也拿到一致结论。研究者在 Dexcom 和 Libre 两种主流 CGM 设备上分别建模,餐后血糖预测的平均绝对误差都是全场最低——21.88 mg/dL,低于最好基线的 22.90。这一结论来自 Google 自己的报告,尚未有第三方复测。

方向

跨队列迁移:少标注能撑起代谢预测吗

GlucoFM 的考题在迁移:把预训练学到的东西搬到一个新队列,标注只剩少量时它还能不能撑住。四个队列、七项任务的成绩单,就是判断依据。

光看血糖曲线,看不出一个人的胰岛素抵抗有多重。判断这类代谢指标要靠临床检查标定,论文直言高质量临床标签稀疏且贵。现实里收集带标注的 CGM 数据,代价比收集血糖曲线本身高得多。

GlucoFM 把标签需求压下去的办法,是先把“规律”学干净。它是一个基础模型(在海量数据上预训练、可适配多种下游任务),按自监督(不用人工标注,直接从数据本身找规律)方式预训练,不看标签,自己预测血糖曲线的每日语境和时间演变。预训练完,在新队列上只需少量标注样本就能适配——这就是少样本(用极少量标注学会新任务)的含义。

成绩单来自四个不同队列、七个临床任务(糖尿病风险、胰岛素抵抗、β 细胞功能障碍、高脂血症、低血糖、肥胖、血糖表型),共 14 个队列-任务组合。与在同一语料上重训、表现最好的 CGM 专用基线相比,GlucoFM 的平均 PR-AUC(衡量预测排序好坏的指标,样本不均衡时更可靠)高出 4.1 个百分点;它在糖尿病风险和 β 细胞功能障碍的所有评估中居首,四个胰岛素抵抗评估里赢下三个。据 Agent5 报道,做到这些只用了 0.72M 参数量(模型里可调权重的总数,越小越省算力)。需要注明:数字来自 Google 自己的评估,截至发文未见第三方复测。

后续看点全在这“迁移”两个字上。GlucoFM 还在研究阶段,模型权重尚未放开。等权重真的放出,看第三方在自己的 CGM 队列上复现时,标注样本砍到多低优势还能保住;还要看双流拆分会不会被后续 CGM 模型沿用。若新队列上少样本优势消失,或后续模型退回单流结构,这个方向就得修正。

动手

先别找 demo,权重还没放出来

GlucoFM 发布当天,论文和博客都公开了,模型权重却没上线。现在能做的,是读论文、盯仓库、看懂一个关键区别。

据 Agent5 和 explainx 报道,Google Research 与 UNSW Sydney 在 8 月 26 日发布了 GlucoFM,但权重(训练好的参数文件,没有它无法运行)标注为 TBD——待公开。官方博客的 Quick links 里只有 Paper 链接,没有下载入口。能先做的是读论文:打开 Paper,看双流结构如何把 CGM(连续血糖监测,皮下传感器每几分钟测一次血糖)曲线拆成缓慢的“状态流”和快速的“事件流”,同时保留时间信息和缺失值(没测到的时间点)。

现在可以动的手
1

打开 Google Research 博客,点 Quick links 里的 Paper 链接,通读双流结构那段。

2

核对论文里的 PR-AUC 数值来源,确认是官方自测而非第三方复测。

3

盯住 Google Research 的发布页或模型仓库,看权重是否上线。

4

记录一周自己的血糖曲线(有条件的话),试着标出慢基线和短波动两类片段。

读论文时带上对比:CGMformer、GluFormer、CGM-JEPA 都把整段血糖曲线当成一条序列处理;GlucoFM 拆成两条。这个区别不跑代码也能看懂。如果你戴着 CGM 设备,翻出自己一周的曲线,把平滑的基线部分和餐后、活动引起的尖峰分开——这就是双流的直觉。

数字部分先别急着记。官方称 PR-AUC(预测排序质量指标,越高越好)平均比最好的 CGM 专用基线高 4.1 个百分点,但那是对比自己训练的基线,还没有第三方复测。等权重或代码公开后,看能不能复现这个数。权重放出来之前,最有价值的动作就一个:把双流思路与轻量设计这个事实记牢。

信源:Google Research Blog(官方博客)。口径说明:本文基于 Google 官方发布的研究成果,内容为 Google 自身叙述,可能存在倾向性;性能数据均来自其论文中的评估。