本文题为《Metabolomic machine learning predictor for diagnosis and prognosis of gastric cancer》作者为Yangzi Chen,Bohong Wang,Yizi Zhao,Xinxin Shao,Mingshuo Wang等。胃癌(GC)是全球癌症相关死亡的重要原因,因此迫切需要开发早期检测策略和精准的术后干预措施。本研究揭示了胃癌的代谢图谱,并确定了两组独特的生物标志物,分别用于早期检测和预后预测,从而推动了胃癌精准医疗的发展。
01 摘要
胃癌是全球高致死性恶性肿瘤,临床缺乏高灵敏度的无创早期诊断手段,且现有预后评估方式精准度不足,难以实现患者精准分层与个体化干预。本研究纳入多中心702例受试者血浆样本,通过液相色谱-质谱联用(LC-MS)靶向代谢组学解析胃癌代谢重编程特征,结合机器学习算法构建两类胃癌预测模型。研究构建的10代谢物诊断模型(10-DM)在外部验证集中灵敏度达0.905,远优于CA19-9、CA72-4、CEA等传统肿瘤蛋白标志物(灵敏度<0.40),可精准识别早期胃癌患者。同时构建的28代谢物预后模型(28-PM),一致性指数(C-index)显著高于传统临床参数模型,可有效将胃癌患者划分为高低风险预后人群。该研究明确了胃癌血浆代谢景观,建立了两套可用于胃癌早期诊断和预后预测的代谢标志物体系,为胃癌精准医疗提供了全新的无创技术方案。
02 研究背景
1.临床痛点
目前胃癌临床诊疗存在两大核心难题:一是胃癌金标准诊断方式为内镜检查,具有侵入性、高成本特点,无法用于大规模人群筛查,而传统血清蛋白标志物灵敏度极低,难以实现早期胃癌检出;二是胃癌预后评估依赖肿瘤位置、TNM分期、组织病理等临床指标,依靠医生经验判断,精准度有限,无法有效指导个体化精准干预与风险分层管理。
2.研究现状与不足
代谢组学可反映基因与环境互作的最终表型,已被广泛用于肿瘤标志物挖掘与机制研究,既往已有多项研究探索代谢标志物在胃癌诊断、预后评估中的价值。但现有研究普遍存在队列样本量小、缺乏独立外部验证、检测方法重复性差、灵敏度低等缺陷,难以转化为临床可用的检测体系。同时,代谢组学数据维度高、复杂度高,传统统计方法难以挖掘潜在的核心代谢特征,而机器学习在组学数据挖掘、模型构建、患者分层中具备独特优势,但在胃癌代谢组学数据分析中的应用尚未充分开展,存在较大研究潜力。
3.研究目的
基于多中心大样本血浆代谢组学数据,结合机器学习算法解析胃癌特异性代谢重编程特征,构建高灵敏度、可重复的无创胃癌早期诊断模型和精准预后预测模型,对比传统临床检测与评估方案的优势,为胃癌精准筛查与个体化治疗提供新的临床转化工具。
03 模型设计
本研究基于代谢组学数据,结合两种机器学习算法,分别设计诊断模型(10-DM)与预后模型(28-PM),全程采用特征筛选-模型训练-内部验证-外部验证的标准化流程,规避过拟合问题,保障模型鲁棒性。
1.胃癌诊断模型(10-DM)
采用LASSO回归+随机森林组合算法构建模型:首先通过LASSO回归对147个检测代谢物进行特征筛选,剔除冗余、无意义变量,筛选出10个核心差异代谢物,分别为琥珀酸、尿苷、乳酸、SAM、焦谷氨酸、2-氨基辛酸、新蝶呤、N-乙酰-D-氨基葡萄糖6-磷酸、血清素、烟酰胺单核苷酸;随后基于10个核心代谢物,采用随机森林算法构建诊断模型,以基尼不纯度为分割准则,构建100棵决策树完成集成学习,通过投票机制输出胃癌预测概率,以0.5为临界值区分胃癌患者与健康对照。
2.胃癌预后模型(28-PM)
采用随机生存森林(RSF)算法构建预后模型:基于181例胃癌患者的代谢组学与随访生存数据,先通过1000棵决策树的随机生存森林模型,依据置换特征重要性筛选预后相关核心代谢特征,最终确定28个关键代谢物;通过对数秩检验分割节点,结合Kaplan–Meier、Nelson–Aalen估计器评估患者生存风险,以2.1为风险评分临界值,将患者分为高风险、低风险预后人群,实现预后分层。
3.模型对比设计
为验证模型优越性,设置多组对照:诊断模型对比传统3项临床肿瘤标志物(CA19-9、CA72-4、CEA)及SVM、逻辑回归、PLS-DA等机器学习模型;预后模型对比TNM分期、大体形态、血管肿瘤栓子等传统临床预后指标,同时验证临床指标联合代谢模型的增益效果。

图1 研究示意图
04 实验设置
1.研究队列与样本
研究共纳入702例多中心受试者,包括389例胃癌患者、313例非胃癌对照,分为3个独立队列,所有受试者采样前未接受抗肿瘤治疗,研究经多家医院伦理审批并获取知情同意:
队列1(建模队列,n=426):145例胃癌患者、281例对照,用于代谢差异分析、诊断模型训练与内部验证;
队列2(外部验证队列,n=95):63例胃癌患者、32例对照,用于诊断模型外部有效性验证;
队列3(预后队列,n=181):胃癌患者,中位随访40个月,用于预后模型构建与验证。
2.实验检测方法
采集受试者空腹外周静脉血浆样本,采用LC-MS靶向代谢组学技术检测样本代谢物,通过甲醇沉淀法提取代谢物,基于MRM模式检测258种内源性水溶性代谢物,最终筛选出147个稳定检出的代谢物用于后续分析。实验设置QC样本监控仪器稳定性,通过批次归一化、数据缩放消除系统误差,严格控制检测质量。
3.数据分析工具与流程
差异代谢分析:采用Wilcoxon秩和检验筛选差异代谢物(FDR<0.05、FC>1.25或FC<0.8),通过R语言Mfuzz包进行代谢轨迹聚类,clusterProfiler包结合KEGG API完成KEGG通路富集分析;
模型构建:基于Python scikit-learn、scikit-survival包完成LASSO回归、随机森林、随机生存森林建模;
统计验证:采用ROC曲线、C-index、Kaplan–Meier生存分析、Cox回归等方法评估模型性能,BH法校正多重检验。
05 结果与分析
1.胃癌血浆代谢重编程特征
PCA分析显示胃癌患者与非胃癌对照血浆代谢谱存在显著差异,证实胃癌存在明显代谢重编程。研究共筛选出45个显著差异代谢物,可分为3类疾病进展轨迹:新蝶呤等代谢物随病情进展持续上调,谷胱甘肽二硫化物、尿苷、乳酸等持续下调。KEGG通路富集显示,谷胱甘肽代谢、半胱氨酸和甲硫氨酸代谢为胃癌最紊乱的代谢通路,氧化应激失衡、甲基供体代谢紊乱是胃癌核心代谢特征,为标志物筛选提供了生物学依据。
2.诊断模型(10-DM)性能结果
10-DM模型在内部测试集AUROC达0.967(灵敏度0.854、特异度0.926),外部验证集AUROC为0.920(灵敏度0.905、特异度0.75)。模型对早期胃癌识别能力优异,IA期胃癌识别准确率79.1%,IB期准确率达92.7%,可有效实现胃癌早期筛查。
性能对比结果:传统单一标志物CA19-9、CA72-4、CEA灵敏度仅0.217、0.317、0.165,三项标志物联合检测灵敏度仅0.428,远低于10-DM模型的0.925;同时10-DM模型性能优于SVM、逻辑回归等其他机器学习模型,且与传统标志物联合可进一步提升灵敏度至0.957,具备临床兼容优势。
3.预后模型(28-PM)性能结果
28-PM模型训练集C-index为0.90,测试集AUROC为0.832、C-index为0.83,预测性能显著优于TNM分期、血管肿瘤栓子等传统临床指标。仅28个代谢物中的11个可独立区分患者生存预后,其余17个代谢物通过复杂协同作用提升模型预测能力,体现了机器学习挖掘隐性代谢关联的优势。
风险分层结果:以2.1为临界值可精准划分高低风险患者,高风险患者总生存期、无病生存期显著更差,死亡、复发转移比例显著更高。多变量Cox回归证实,28-PM模型是胃癌患者预后的独立危险因素。此外,临床指标联合代谢模型仅小幅提升性能(增益1%),证明代谢特征是预后预测的核心主导因素。
图2 对照组血浆代谢状况
06 结论
07 论文评价
✅方法创新亮点
1.临床价值突出:构建了无创、高灵敏度的胃癌早期诊断与预后预测双模型,彻底解决了传统标志物灵敏度低、传统预后评估精准度不足的临床痛点,尤其突破了早期胃癌无创筛查的难题。
2.实验设计严谨:基于多中心大样本队列,设置独立内外验证集,模型鲁棒性与重复性强;严格的样本质控、数据归一化处理,有效规避了批次误差与检测偏差。
3.方法学创新:将机器学习与靶向代谢组学深度结合,通过LASSO+随机森林、随机生存森林算法,挖掘出传统统计方法无法识别的代谢特征关联,高效筛选出核心标志物组合。
⚠方法不足
1.随访时长不足:预后队列中位随访时间仅40个月,未达到5年标准,部分患者存在截尾数据,可能影响预后模型的长期预测准确性。
2.临床落地条件受限:模型基于相对定量代谢数据构建,临床应用需配套质控样本,尚未建立代谢物正常参考阈值,无法直接用于临床常规检测。
08 参考资料
Article:
编辑:杨梦洁
审核:吴朝


