大数跨境

nature communications(一区|IF=18.1)用于胃癌诊断和预后的代谢组学机器学习预测模型

nature communications(一区|IF=18.1)用于胃癌诊断和预后的代谢组学机器学习预测模型 瓴智医学AI
2026-08-15
2
导读:nature communications(一区|IF=18.1)用于胃癌诊断和预后的代谢组学机器学习预测模型

本文题为《Metabolomic machine learning predictor for diagnosis and prognosis of gastric cancer》作者为Yangzi Chen,Bohong Wang,Yizi Zhao,Xinxin Shao,Mingshuo Wang等。胃癌(GC)是全球癌症相关死亡的重要原因,因此迫切需要开发早期检测策略和精准的术后干预措施。本研究揭示了胃癌的代谢图谱,并确定了两组独特的生物标志物,分别用于早期检测和预后预测,从而推动了胃癌精准医疗的发展。

01 摘要

胃癌是全球高致死性恶性肿瘤,临床缺乏高灵敏度的无创早期诊断手段,且现有预后评估方式精准度不足,难以实现患者精准分层与个体化干预。本研究纳入多中心702例受试者血浆样本,通过液相色谱-质谱联用(LC-MS)靶向代谢组学解析胃癌代谢重编程特征,结合机器学习算法构建两类胃癌预测模型。研究构建的10代谢物诊断模型(10-DM)在外部验证集中灵敏度达0.905,远优于CA19-9、CA72-4、CEA等传统肿瘤蛋白标志物(灵敏度<0.40),可精准识别早期胃癌患者。同时构建的28代谢物预后模型(28-PM),一致性指数(C-index)显著高于传统临床参数模型,可有效将胃癌患者划分为高低风险预后人群。该研究明确了胃癌血浆代谢景观,建立了两套可用于胃癌早期诊断和预后预测的代谢标志物体系,为胃癌精准医疗提供了全新的无创技术方案。

02 研究背景

  1. 1.临床痛点

    目前胃癌临床诊疗存在两大核心难题:一是胃癌金标准诊断方式为内镜检查,具有侵入性、高成本特点,无法用于大规模人群筛查,而传统血清蛋白标志物灵敏度极低,难以实现早期胃癌检出;二是胃癌预后评估依赖肿瘤位置、TNM分期、组织病理等临床指标,依靠医生经验判断,精准度有限,无法有效指导个体化精准干预与风险分层管理。

    2.研究现状与不足

    代谢组学可反映基因与环境互作的最终表型,已被广泛用于肿瘤标志物挖掘与机制研究,既往已有多项研究探索代谢标志物在胃癌诊断、预后评估中的价值。但现有研究普遍存在队列样本量小、缺乏独立外部验证、检测方法重复性差、灵敏度低等缺陷,难以转化为临床可用的检测体系。同时,代谢组学数据维度高、复杂度高,传统统计方法难以挖掘潜在的核心代谢特征,而机器学习在组学数据挖掘、模型构建、患者分层中具备独特优势,但在胃癌代谢组学数据分析中的应用尚未充分开展,存在较大研究潜力。

    3.研究目的

    基于多中心大样本血浆代谢组学数据,结合机器学习算法解析胃癌特异性代谢重编程特征,构建高灵敏度、可重复的无创胃癌早期诊断模型和精准预后预测模型,对比传统临床检测与评估方案的优势,为胃癌精准筛查与个体化治疗提供新的临床转化工具

03 模型设计


本研究基于代谢组学数据,结合两种机器学习算法,分别设计诊断模型(10-DM)预后模型(28-PM),全程采用特征筛选-模型训练-内部验证-外部验证的标准化流程,规避过拟合问题,保障模型鲁棒性。

1.胃癌诊断模型(10-DM)

采用LASSO回归+随机森林组合算法构建模型:首先通过LASSO回归对147个检测代谢物进行特征筛选,剔除冗余、无意义变量,筛选出10个核心差异代谢物,分别为琥珀酸、尿苷、乳酸、SAM、焦谷氨酸、2-氨基辛酸、新蝶呤、N-乙酰-D-氨基葡萄糖6-磷酸、血清素、烟酰胺单核苷酸;随后基于10个核心代谢物,采用随机森林算法构建诊断模型,以基尼不纯度为分割准则,构建100棵决策树完成集成学习,通过投票机制输出胃癌预测概率,以0.5为临界值区分胃癌患者与健康对照。

2.胃癌预后模型(28-PM)

采用随机生存森林(RSF)算法构建预后模型:基于181例胃癌患者的代谢组学与随访生存数据,先通过1000棵决策树的随机生存森林模型,依据置换特征重要性筛选预后相关核心代谢特征,最终确定28个关键代谢物;通过对数秩检验分割节点,结合Kaplan–Meier、Nelson–Aalen估计器评估患者生存风险,以2.1为风险评分临界值,将患者分为高风险、低风险预后人群,实现预后分层。

3.模型对比设计

为验证模型优越性,设置多组对照:诊断模型对比传统3项临床肿瘤标志物(CA19-9、CA72-4、CEA)及SVM、逻辑回归、PLS-DA等机器学习模型;预后模型对比TNM分期、大体形态、血管肿瘤栓子等传统临床预后指标,同时验证临床指标联合代谢模型的增益效果。

Fig. 1: Schematic overview of the study.

图1 研究示意图

04 实验设置

1.研究队列与样本

研究共纳入702例多中心受试者,包括389例胃癌患者、313例非胃癌对照,分为3个独立队列,所有受试者采样前未接受抗肿瘤治疗,研究经多家医院伦理审批并获取知情同意:

队列1(建模队列,n=426)145例胃癌患者、281例对照,用于代谢差异分析、诊断模型训练与内部验证;

队列2(外部验证队列,n=95)63例胃癌患者、32例对照,用于诊断模型外部有效性验证;

队列3(预后队列,n=181):胃癌患者,中位随访40个月,用于预后模型构建与验证。

2.实验检测方法

采集受试者空腹外周静脉血浆样本,采用LC-MS靶向代谢组学技术检测样本代谢物,通过甲醇沉淀法提取代谢物,基于MRM模式检测258种内源性水溶性代谢物,最终筛选出147个稳定检出的代谢物用于后续分析。实验设置QC样本监控仪器稳定性,通过批次归一化、数据缩放消除系统误差,严格控制检测质量

3.数据分析工具与流程

差异代谢分析:采用Wilcoxon秩和检验筛选差异代谢物(FDR<0.05、FC>1.25或FC<0.8),通过R语言Mfuzz包进行代谢轨迹聚类,clusterProfiler包结合KEGG API完成KEGG通路富集分析;

模型构建:基于Python scikit-learn、scikit-survival包完成LASSO回归、随机森林、随机生存森林建模;

统计验证:采用ROC曲线、C-index、Kaplan–Meier生存分析、Cox回归等方法评估模型性能,BH法校正多重检验。

05 结果与分析

1.胃癌血浆代谢重编程特征

PCA分析显示胃癌患者与非胃癌对照血浆代谢谱存在显著差异,证实胃癌存在明显代谢重编程。研究共筛选出45个显著差异代谢物,可分为3类疾病进展轨迹:新蝶呤等代谢物随病情进展持续上调,谷胱甘肽二硫化物、尿苷、乳酸等持续下调。KEGG通路富集显示,谷胱甘肽代谢、半胱氨酸和甲硫氨酸代谢为胃癌最紊乱的代谢通路,氧化应激失衡、甲基供体代谢紊乱是胃癌核心代谢特征,为标志物筛选提供了生物学依据。

2.诊断模型(10-DM)性能结果

10-DM模型在内部测试集AUROC达0.967(灵敏度0.854、特异度0.926),外部验证集AUROC为0.920(灵敏度0.905、特异度0.75)。模型对早期胃癌识别能力优异,IA期胃癌识别准确率79.1%,IB期准确率达92.7%,可有效实现胃癌早期筛查。

性能对比结果:传统单一标志物CA19-9、CA72-4、CEA灵敏度仅0.217、0.317、0.165,三项标志物联合检测灵敏度仅0.428,远低于10-DM模型的0.925;同时10-DM模型性能优于SVM、逻辑回归等其他机器学习模型,且与传统标志物联合可进一步提升灵敏度至0.957,具备临床兼容优势。

3.预后模型(28-PM)性能结果

28-PM模型训练集C-index为0.90,测试集AUROC为0.832、C-index为0.83,预测性能显著优于TNM分期、血管肿瘤栓子等传统临床指标。仅28个代谢物中的11个可独立区分患者生存预后,其余17个代谢物通过复杂协同作用提升模型预测能力,体现了机器学习挖掘隐性代谢关联的优势。

风险分层结果:以2.1为临界值可精准划分高低风险患者,高风险患者总生存期、无病生存期显著更差,死亡、复发转移比例显著更高。多变量Cox回归证实,28-PM模型是胃癌患者预后的独立危险因素。此外,临床指标联合代谢模型仅小幅提升性能(增益1%),证明代谢特征是预后预测的核心主导因素。

Fig. 2: Reprogrammed plasma metabolic landscape of GC patients compared with non-GC controls.

图2 对照组血浆代谢状况

图3 基于血浆代谢组的机器学习预测模型

06 结论

本研究采用基于液相色谱-质谱法的靶向代谢组学分析方法,对来自多个研究中心的癌症患者和非癌症对照组的血浆样本进行了分析。通过机器学习技术,基于代谢组学数据建立了诊断模型,并进行了验证。值得注意的是,这种诊断方法在识别处于 IA 期及其他阶段的患者的能力方面,优于使用癌症相关蛋白标志物(如碳水化合物抗原 19-9、癌症抗原 72-4 和癌胚抗原)的传统方法。此外,预后生物标志物组的一致性指数显著高于采用临床指标的传统方法,这表明该模型在预测临床结果方面表现更为出色。此外,基于模型的患者风险分层还可以为临床决策提供参考依据。总的来说,我们的研究提供了实证结果,表明在代谢组学数据分析中应用机器学习技术能够带来诸多优势,有助于实现癌症诊断中的早期检测和精准医疗。

07 论文评价

方法创新亮点

1.临床价值突出:构建了无创、高灵敏度的胃癌早期诊断与预后预测双模型,彻底解决了传统标志物灵敏度低、传统预后评估精准度不足的临床痛点,尤其突破了早期胃癌无创筛查的难题。

2.实验设计严谨:基于多中心大样本队列,设置独立内外验证集,模型鲁棒性与重复性强;严格的样本质控、数据归一化处理,有效规避了批次误差与检测偏差。

3.方法学创新:将机器学习与靶向代谢组学深度结合,通过LASSO+随机森林、随机生存森林算法,挖掘出传统统计方法无法识别的代谢特征关联,高效筛选出核心标志物组合。

方法不足

1.随访时长不足:预后队列中位随访时间40个月,未达到5年标准,部分患者存在截尾数据,可能影响预后模型的长期预测准确性。

2.临床落地条件受限:模型基于相对定量代谢数据构建,临床应用需配套质控样本,尚未建立代谢物正常参考阈值,无法直接用于临床常规检测。

08 参考资料

Article:

https://doi.org/10.1038/s41467-024-46043-y

图文:郑家仪

编辑:杨梦洁

审核:吴朝


Nature Medicine(一区,IF=50)人工智能在全国乳腺钼靶筛查中的落地应用研究
Advanced Science(一区|IF=14.1)机器学习增强的超灵敏免疫CRISPR阵列通过检测多种血浆生物标志物,促进阿尔茨海默病的早期诊断
Nature Medicine(一区 IF=50)基于大语言模型的临床医学文献系统综述
Nature Communications(一区|IF=15.7)通过基于机器学习的增强采样工作流程,针对那些具有内在无序结构的AR-NTD进行建模.-

【声明】内容源于网络
0
0
瓴智医学AI
分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
内容 78
粉丝 0
瓴智医学AI 分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
总阅读2.0k
粉丝0
内容78