CGM 血糖预测
以过去一段 CGM 血糖序列预测未来 30 或 60 分钟血糖,适合 GlucoBench、Shanghai、Ohio、Granada 和 DiaTrend。
Summary
本页面梳理血糖 AI 领域中“有数据、 有代码、可复现”的关键资源,并将后续研究组织为四条实验线:CGM 短期血糖预测、中国人群糖尿病管理模型、多模态无创/间接血糖估计、拉曼糖尿病筛查。目前 GlucoBench 已跑通线性回归与 N-HiTS 基线,ShanghaiT1DM/T2DM、PhysioCGM 和 Guevara Raman 已下载并完成接入分析;GluFormer(Nature 2026 CGM 基础模型)官方 demo 也已用上海数据完成外部验证。OhioT1DM、T1DiabetesGranada 和 DiaTrend 接入文档均已就绪,正并行申请,作为后续更标准、更大规模的 benchmark 数据。
以过去一段 CGM 血糖序列预测未来 30 或 60 分钟血糖,适合 GlucoBench、Shanghai、Ohio、Granada 和 DiaTrend。
基于 ShanghaiT1DM/T2DM 的中国患者 CGM、饮食、临床检验和用药信息,探索更贴近本土饮食结构和 2 型糖尿病管理场景的算法。
用 ECG、PPG、EDA、体温、加速度等非侵入式信号映射到 CGM 标签,适合探索无创血糖算法。
用人体皮肤拉曼光谱识别糖尿病长期代谢状态,不等同于无创 CGM,但适合验证拉曼机器学习路线。
Priority A
这四个资源适合第一阶段就下载代码、整理数据、跑通 notebook 或 baseline,形成可演示的本地实验结果。
CGM 血糖预测 benchmark
围绕公开 CGM 数据构建的标准化 benchmark,包含数据清洗、formatter、训练脚本、模型实现、结果复现和示例数据。本地已跑通线性回归与 N-HiTS 基线,覆盖 iglu / colas / weinstock 的 30 与 60 分钟预测(MPS GPU)。
多模态生理信号 + CGM
10 名 1 型糖尿病受试者,最长约 17 天真实世界采集,包含 ECG、PPG/BVP、EDA、体温、加速度、呼吸和 Dexcom G6 CGM 标签。已下载单受试者样本并完成解压。
中国糖尿病 CGM 与饮食数据
包含 12 名 T1D 和 100 名 T2D 患者,提供 3-14 天 CGM、每日饮食、临床特征、实验室检查和用药信息。已下载原始数据并克隆 BG_prediction_benchmark 与 GARNN 两个预测仓库;GluFormer(Nature 2026)官方 demo 亦用其做外部验证,1024 维表征预测 HbA1c 的相关性 r=0.451,优于传统 GMI 的 0.409。
拉曼光谱糖尿病筛查
20 名受试者(11 名 DM2 + 9 名健康对照)、4 个皮肤部位拉曼光谱,面向 DM2 与健康对照二分类。已下载 Kaggle 数据与官方代码;测的是 AGEs 长期糖化指纹,属糖尿病筛查而非即时血糖预测。
Controlled Access
这些数据集更经典或规模更大,适合作为第二阶段严肃 benchmark。建议尽早提交数据访问申请。
12 名 T1D,每人约 8 周数据,包含 CGM、指尖血、胰岛素、饮食、运动、睡眠等,是血糖预测领域经典 benchmark。协变量最丰富(含手环生理信号),接入分析文档已建,待签 DUA。
736 名 T1D,约 257,780 天 CGM,最长 4 年纵向记录。适合大规模 CGM 预测、可解释性和群体/个体模型对比,是规模端上界。接入分析文档已建,待 Zenodo 申请。
54 名糖尿病患者,27,561 天 CGM 和 8,220 天胰岛素泵数据,适合长期趋势、胰岛素动态和 AID 相关算法,是小时级轨迹与长时域实验的理想试验场。接入分析文档已建,待 Synapse 认证。
Tooling
这些资源不一定是数据集本身,但适合统一训练、评估、复现或扩展模型。
Roadmap
把“可下载、能跑通、能比较”作为第一目标,避免一开始陷入申请周期或复杂临床数据清洗。
Clone GlucoBench,下载 PhysioCGM、ShanghaiT1DM/T2DM 和 Guevara Raman,分别复现一个最小可运行实验。
提交 OhioT1DM、T1DiabetesGranada、DiaTrend 的访问申请,为后续 benchmark 和论文级对比做准备。
把数据下载、预处理、模型训练、评估指标和结果报告统一到一个本地目录,避免每个仓库各跑一套。
分别建立 CGM 血糖预测、中国人群糖尿病管理模型、多模态无创估计、拉曼糖尿病筛查四条路线,并在统一指标下比较模型表现。
Local Lab
目录设计重点是把原始数据、处理后数据、外部仓库、实验脚本和报告分开,便于复现和后续扩展。
blood-glucose-repro/
datasets/
raw/
shanghai/ ✅ 已下载 + 接入文档
physiocgm/ ✅ 已下载样本
ohio/ ⏳ 待申请(接入文档已建)
granada/ ⏳ 待申请(接入文档已建)
diatrend/ ⏳ 待申请(接入文档已建)
processed/
repos/
GlucoBench/ ✅ 已跑通基线
BG_prediction_benchmark/ ✅ 已克隆
garnn_public/ ✅ 已克隆(误差网格)
PhysioCGM/ ✅ 已克隆
raman-diabetes/ ✅ 已克隆(Guevara)
GluPredKit/ ⏳ 待安装
reports/
benchmark_results/ ✅ cgm-prediction-benchmark.md
reproduction_notes/
dataset_cards/
CGM 血糖预测:GlucoBench、ShanghaiT1DM/T2DM、OhioT1DM、T1DiabetesGranada、DiaTrend。
中国人群糖尿病管理模型:ShanghaiT1DM/T2DM,重点做饮食-血糖响应、2 型糖尿病管理和本土化模型验证。
多模态无创估计:PhysioCGM,重点做 ECG、PPG、EDA、温度和加速度融合。
拉曼糖尿病筛查:Guevara 2018 Raman Diabetes,复现 PCA-SVM/ANN 并扩展现代模型。