Google Research 发布 GlucoFM,一个轻量级 CGM 基础模型,把血糖曲线分离为慢速基线趋势与短时波动两条流进行自监督学习。在四个队列、七项临床预测任务中,其 PR-AUC 平均比最强的 CGM 专用基线高出 4.1 个百分点,并能以极少量标注数据预测糖尿病风险、胰岛素抵抗等代谢指标。
一条血糖曲线,拆成两条流
2026年8月26日,Google Research与UNSW Sydney联合发布GlucoFM,一款自监督基础模型(在大规模数据上预训练,可适配多种任务)。它把连续血糖监测数据拆成两条独立流——慢速生理趋势和短期波动——分别建模。
GlucoFM的核心设计是双流编码器。一条处理低频状态分量,代表血糖的缓慢基线变化;另一条处理残差事件分量,捕捉餐后、运动或传感器伪影造成的短时偏差。输入对齐到24小时、5分钟网格,并保留观测掩码,让模型知道哪些时间点有真实数据。这种结构与现有CGM模型不同:CGMformer、GluFormer、CGM-JEPA均把血糖序列当作单一流处理,未显式分离快慢成分。
评估结果来自4个队列、7项临床任务,共14项队列-任务组合。GlucoFM的平均PR-AUC比同一预训练语料下重训的最强 CGM 专用基线高出4.1个百分点(54.7→58.8,相对约+7.5%)。在糖尿病风险评估和β细胞功能障碍判断上,它全部领先;胰岛素抵抗评估中,4项里领先3项。评测还覆盖高脂血症、低血糖、肥胖和糖型(glucotype)分类。目前该项目为研究阶段,权重尚未公开。
CGM 数据不是均匀的,它拆成两条流来学
GlucoFM 的核心理念很简单:血糖曲线里的慢趋势和短波动,不应该被塞进同一个通道里处理。
连续血糖监测仪每几分钟记录一次组织间液葡萄糖浓度,CGM(连续血糖监测,通过皮下传感器每几分钟记录一次血糖值)。
但这条曲线不是均匀的——它包含缓慢变化的基线(比如空腹和夜间模式)和快速波动的偏差(来自吃饭、运动或传感器噪点)。此前的主流模型,包括 CGMformer、GluFormer 和 CGM-JEPA,都用一个单流编码器处理整个序列。
Google Research 和 UNSW Sydney 的研究者觉得这不对:基线模式和事件模式是两种不同生理信号,混在一起学,互相干扰。
GlucoFM 把一条 CGM 轨迹分解成两条流:一条捕捉慢速生理“状态”,另一条捕捉瞬时“事件”。两条流都保留时间戳和缺失标记,然后分别用两套 JEPA 风格的目标函数做自监督学习预训练(一种训练方法,让模型从数据本身的结构中学习,无需人工标注标签)。这样一来,模型在预训练阶段就学会了区分“这个人的空腹血糖基线是多少”和“刚才那顿饭引起了多大波动”。
(来源:Google Research 论文,2026-08-26)
(来源:Agent5,2026-08-27)
(来源:Google Research 论文,2026-08-26)
双流设计的直接好处是:模型对标注数据的需求降低。传统方法要预测糖尿病风险或胰岛素抵抗,通常需要大量临床标注的 CGM 记录。GlucoFM 先用前文提到的那批未标注数据预训练,然后只用少量标注样本微调(在预训练好的模型基础上,用小量特定任务数据做进一步训练,让它适应新任务)就能迁移到新任务。Google 在论文中报告,GlucoFM 在糖尿病风险评估、胰岛素抵抗、β细胞功能障碍等 7 项临床预测任务上,达到了前文提到的性能提升。
关键在于,GlucoFM 并没有用更大的模型来赢得优势——据行业媒体 Agent5 报道,它的编码器参数只有 0.72M。官方博客未披露参数量,也没有公开完整权重,更没有第三方复测结果。双流策略是否在所有场景下都优于单流,还需要独立验证。
轻量设计,凭什么赢?
Google Research 发布的 GlucoFM,在 14 项队列-任务评估上,平均 PR-AUC(精确率-召回率曲线下面积,衡量预测排序质量)比最强的 CGM 专用基线高 4.1 个百分点。它有多大?据 Agent5 报道,只有 0.72M 个可训练参数。
过去处理连续血糖监测(CGM)数据的基础模型(在大规模数据上预训练、可适配多种任务的通用模型),都把整条血糖曲线当作一条流来学。GlucoFM 偏不:它用自监督(不用人工标注,自己从数据里找规律)预训练,把曲线拆成两条流——一条慢速的生理“状态”,一条短暂的“事件”波动。拆开之后,每条流只需学会一个更简单的任务。
拆开没丢信息,反而赢了。四个队列、七项临床任务上,GlucoFM 的 PR-AUC 平均比最强基线高 4.1 个百分点。糖尿病风险和 β 细胞功能障碍的所有评估,它都排第一;胰岛素抵抗的四项评估中它赢了三项。
据行业媒体报道,0.72M 参数对基础模型来说小得反常。它能赢,很可能靠的是双流结构把问题拆成两个更简单的子问题:一条流学“今天血糖的底色”,另一条流学“刚才发生了什么”。
跨设备也拿到一致结论。研究者在 Dexcom 和 Libre 两种主流 CGM 设备上分别建模,餐后血糖预测的平均绝对误差都是全场最低——21.88 mg/dL,低于最好基线的 22.90。这一结论来自 Google 自己的报告,尚未有第三方复测。
跨队列迁移:少标注能撑起代谢预测吗
GlucoFM 的考题在迁移:把预训练学到的东西搬到一个新队列,标注只剩少量时它还能不能撑住。四个队列、七项任务的成绩单,就是判断依据。
光看血糖曲线,看不出一个人的胰岛素抵抗有多重。判断这类代谢指标要靠临床检查标定,论文直言高质量临床标签稀疏且贵。现实里收集带标注的 CGM 数据,代价比收集血糖曲线本身高得多。
GlucoFM 把标签需求压下去的办法,是先把“规律”学干净。它是一个基础模型(在海量数据上预训练、可适配多种下游任务),按自监督(不用人工标注,直接从数据本身找规律)方式预训练,不看标签,自己预测血糖曲线的每日语境和时间演变。预训练完,在新队列上只需少量标注样本就能适配——这就是少样本(用极少量标注学会新任务)的含义。
成绩单来自四个不同队列、七个临床任务(糖尿病风险、胰岛素抵抗、β 细胞功能障碍、高脂血症、低血糖、肥胖、血糖表型),共 14 个队列-任务组合。与在同一语料上重训、表现最好的 CGM 专用基线相比,GlucoFM 的平均 PR-AUC(衡量预测排序好坏的指标,样本不均衡时更可靠)高出 4.1 个百分点;它在糖尿病风险和 β 细胞功能障碍的所有评估中居首,四个胰岛素抵抗评估里赢下三个。据 Agent5 报道,做到这些只用了 0.72M 参数量(模型里可调权重的总数,越小越省算力)。需要注明:数字来自 Google 自己的评估,截至发文未见第三方复测。
后续看点全在这“迁移”两个字上。GlucoFM 还在研究阶段,模型权重尚未放开。等权重真的放出,看第三方在自己的 CGM 队列上复现时,标注样本砍到多低优势还能保住;还要看双流拆分会不会被后续 CGM 模型沿用。若新队列上少样本优势消失,或后续模型退回单流结构,这个方向就得修正。
先别找 demo,权重还没放出来
GlucoFM 发布当天,论文和博客都公开了,模型权重却没上线。现在能做的,是读论文、盯仓库、看懂一个关键区别。
据 Agent5 和 explainx 报道,Google Research 与 UNSW Sydney 在 8 月 26 日发布了 GlucoFM,但权重(训练好的参数文件,没有它无法运行)标注为 TBD——待公开。官方博客的 Quick links 里只有 Paper 链接,没有下载入口。能先做的是读论文:打开 Paper,看双流结构如何把 CGM(连续血糖监测,皮下传感器每几分钟测一次血糖)曲线拆成缓慢的“状态流”和快速的“事件流”,同时保留时间信息和缺失值(没测到的时间点)。
打开 Google Research 博客,点 Quick links 里的 Paper 链接,通读双流结构那段。
核对论文里的 PR-AUC 数值来源,确认是官方自测而非第三方复测。
盯住 Google Research 的发布页或模型仓库,看权重是否上线。
记录一周自己的血糖曲线(有条件的话),试着标出慢基线和短波动两类片段。
读论文时带上对比:CGMformer、GluFormer、CGM-JEPA 都把整段血糖曲线当成一条序列处理;GlucoFM 拆成两条。这个区别不跑代码也能看懂。如果你戴着 CGM 设备,翻出自己一周的曲线,把平滑的基线部分和餐后、活动引起的尖峰分开——这就是双流的直觉。
数字部分先别急着记。官方称 PR-AUC(预测排序质量指标,越高越好)平均比最好的 CGM 专用基线高 4.1 个百分点,但那是对比自己训练的基线,还没有第三方复测。等权重或代码公开后,看能不能复现这个数。权重放出来之前,最有价值的动作就一个:把双流思路与轻量设计这个事实记牢。
信源:Google Research Blog(官方博客)。口径说明:本文基于 Google 官方发布的研究成果,内容为 Google 自身叙述,可能存在倾向性;性能数据均来自其论文中的评估。