基于连续血糖监测的2型糖尿病代谢亚型预测
从血糖曲线中寻找疾病机制:不仅判断血糖“高不高”,还进一步识别异常可能来自哪个代谢环节。
项目背景
2型糖尿病具有明显的异质性。即使患者都表现为血糖升高,其背后的生理机制也可能不同,涉及肌肉或肝脏胰岛素抵抗、β细胞功能不足以及肠促胰素效应受损等多个环节。研究利用口服葡萄糖耐量试验(OGTT)与连续血糖监测(CGM)产生的血糖时序数据,通过机器学习分别预测四种代谢亚型。
研究目标
- 探索血糖曲线形状中是否包含可识别的代谢机制信息;
- 为四种代谢亚型分别筛选合适的特征表达和分类器;
- 验证家庭环境下采集的CGM数据是否具有实际预测潜力。
数据概况
研究由深度代谢测量队列、独立验证队列和家庭CGM测试队列组成。金标准代谢指标用于定义四个彼此独立的二分类任务,因此同一个人可能同时具有多种异常机制,并非只能归入一个类别。
32人深度代谢测量训练队列
24人独立验证队列
29人家庭CGM测试队列
四个预测目标
| 代谢亚型 | 中文含义 | 模型输出 |
|---|---|---|
| Muscle IR | 肌肉胰岛素抵抗 | 异常风险概率 |
| β-cell dysfunction | β细胞功能不足 | 功能障碍风险概率 |
| Impaired incretin | 肠促胰素效应受损 | 效应受损风险概率 |
| Hepatic IR | 肝脏胰岛素抵抗 | 异常风险概率 |
方法学与建模流程
研究先对OGTT、CGM、人口学信息和代谢测量进行时间轴对齐与质量控制,再比较不同血糖曲线表征和分类器。每个任务都单独选择表现最佳的组合,而不是让四个任务共用一套模型。
数据采集OGTT、CGM、人口学与代谢检测
预处理时间轴对齐、缺失与单位检查
特征与模型比较ReducedRep/PCA、曲线特征及多类分类器
独立输出四个模型分别给出风险概率
各任务的最优建模路线
| 预测任务 | 最佳特征组合 | 分类器 | 参数 |
|---|---|---|---|
| Muscle IR | 人口学信息 + ReducedRep/PCA | L1 Logistic | C = 10 |
| β-cell dysfunction | 人口学信息 + ReducedRep/PCA | Linear SVM | C = 0.005 |
| Impaired incretin | 人口学信息 + Curve Features | RBF SVM | C = 10 |
| Hepatic IR | 人口学信息 + Matsuda指数 | Linear SVM | C = 0.001 |
ReducedRep/PCA保留时序曲线的整体形状信息;Curve Features将曲线转化为面积、峰值、斜率等可解释指标。
模型性能
1. 训练队列交叉验证AUC
Muscle IR
94.2%
β-cell dysfunction
95.6%
Impaired incretin
91.5%
Hepatic IR
75.9%
以上数值为训练队列的交叉验证结果,并非家庭环境测试结果。
2. 家庭CGM测试
| 预测任务 | 家庭测试结果 | 说明 |
|---|---|---|
| Muscle IR | AUC 88% | 家庭数据独立测试 |
| β-cell dysfunction | AUC 84% | 家庭数据独立测试 |
| Impaired incretin | 暂未报告独立AUC | 公开家庭标签不足 |
| Hepatic IR | 暂未报告独立AUC | 公开家庭标签不足 |
研究结论与应用价值
关键发现
- OGTT血糖曲线的动态形状可以提供超越单个血糖值的代谢机制信息;
- 不同亚型需要不同的特征表达与分类算法,逐任务选优比使用统一路线更合适;
- 家庭CGM对肌肉胰岛素抵抗和β细胞功能不足显示出较好的识别潜力。
潜在应用
- 辅助分型:从日常血糖时序数据中识别可能的代谢异常环节;
- 个体化干预:为营养、运动和治疗策略提供更具机制针对性的参考;
- 居家监测:降低复杂代谢检测对时间、场地和专业设备的依赖。
结果解读说明
该模型输出的是四个相互独立的风险概率,不能理解为四选一的诊断结果。家庭队列样本量有限,肠促胰素效应受损和肝脏胰岛素抵抗尚缺少足够公开标签来报告独立AUC;研究结果适合作为科研与辅助评估依据,不替代临床诊断。
案例介绍视频
点击下方按钮观看中文演示,了解代谢亚型预测的研究流程与模型应用(约2分48秒)。
▶ 查看介绍视频