大数跨境

JAMA Network Open (一区,IF=11.7)Serial‑CTRS:基于时序 CT 深度学习预测免疫治疗非小细胞肺癌患者生存结局

JAMA Network Open (一区,IF=11.7)Serial‑CTRS:基于时序 CT 深度学习预测免疫治疗非小细胞肺癌患者生存结局 瓴智医学AI
2026-09-30
5
导读:JAMA Network Open (一区,IF=11.7)Serial‑CTRS:基于时序 CT 深度学习预测免疫治疗非小细胞肺癌患者生存结局

本文题为《Deep‑Learning Serial CT Prediction of Survival in Immunotherapy‑Treated Non–Small Cell Lung Cancer》由 Chiharu Sako, Brenda F. Kurland, Taly G. Schmidt 等多位学者共同完成,作者单位包括 Onc.AI、GSK、多所欧美大学医学中心与肿瘤机构。晚期非小细胞肺癌接受免疫检查点抑制剂治疗后,传统 RECIST、肿瘤体积变化 TVC 对长期总生存预测能力有限,且依赖人工病灶测量。针对上述问题,该研究构建 Serial‑CTRS 自动化深度学习影像生物标志物,利用基线及 12 周随访时序胸部 CT 预测患者总生存,依托真实世界队列构建模型,并采用真实世界测试集、GARNET 临床试验队列双重外部验证,结果显示 Serial‑CTRS 生存风险分层效果优于 RECIST 与 TVC,在 PD‑L1 各亚组以及 RECIST 疾病稳定亚组同样有效。该模型无需人工病灶标注,为免疫治疗晚期非小细胞肺癌的临床决策、临床试验终点设计提供新的无创影像标志物。

01 摘要

晚期非小细胞肺癌接受免疫检查点抑制剂治疗后,缺少可靠的早期总生存预测生物标志物。传统 RECIST、肿瘤体积变化 TVC 作为影像评价手段对长期生存结局预测能力有限。本研究开发完全自动化深度学习影像标志物 Serial‑CTRS,输入基线与治疗 12 周配对胸部 CT,实现晚期 NSCLC 患者 ICI 治疗后总生存预测。研究纳入 1830 例患者,包含 RCP 发现集 1171 例、RCP 真实世界测试集 605 例、GARNET 临床试验外部验证集 54 例。多变量校正年龄、性别、PD‑L1 表达、组织学、肿瘤体积等因素后,Serial‑CTRS 与总生存显著相关;在 RCP 测试集与 GARNET 数据集,Serial‑CTRS 风险分层效果优于 RECIST 以及 TVC;在 PD‑L1 各亚组,以及 RECIST 判定疾病稳定人群中依旧保持有效分层能力。该自动化影像生物标志物,仅使用常规临床 CT 即可实现总生存预测,性能优于传统影像评估指标,有望用于临床实践以及肿瘤临床试验。

02 研究背景

一、研究问题

1.晚期 NSCLC 免疫检查点抑制剂治疗,缺少可靠早期生物标志物预判患者长期总生存;RECIST、TVC 是当前主流影像评价标准,但免疫治疗会出现混合应答、假性进展,RECIST 对 OS 的替代价值有限,同时存在阅片者主观差异。
2.多数 CT 影像组学模型需要人工勾画肿瘤病灶,依赖肿瘤区域提取特征,无法利用全胸范围的潜在预后信息,自动化程度不足,难以落地常规临床流程。 
3.多数影像预测模型仅做单中心内部验证,缺少真实世界临床队列 + 临床试验队列两套独立外部验证,模型泛化能力存疑。   
4.RECIST 评估为疾病稳定 SD 的患者群体内部生存异质性大,现有指标很难对这部分人群做进一步风险分层。

二、相关工作

1.RECIST 实体瘤评价标准:广泛用于肿瘤临床试验疗效评估,依靠病灶长径总和,免疫治疗场景存在局限,观察者间变异较大。


2.传统手工影像组学:需要人工勾画肿瘤,提取预定义形态、纹理特征,依赖标注人力。
3.既往时序 CT 深度学习预后模型:大多聚焦肿瘤局部区域特征,缺少全胸建模,缺少临床试验队列的外部验证。
4.免疫治疗生物标志物研究:PD‑L1 是主流组织标志物,但不能完全预测免疫治疗后总生存,需要无创影像标志物作为补充。

03 模型设计


    1. 模型输入:配对基线治疗前 CT + ICI 治疗 12 周随访胸部三维 CT;无需人工病灶标注,输入完整胸部影像;统一做图像预处理、质量控制。


图 1 Serial‑CTRS 模型整体架构、时序 CT 输入与输出流程图

2.骨干网络:分层三维卷积神经网络 3D‑CNN;学习全胸 CT 范围内和生存相关的图像特征,不只局限肿瘤区域。
3.输出头设计:提取的影像特征送入 Cox 比例风险回归头,模型输出 Serial‑CTRS 连续分数(0‑1),代表患者 12 个月总生存概率。
4.训练策略:RCP 发现集 1171 例多中心真实世界数据;6 折交叉验证优化超参;使用 dropout、图像增强防止过拟合;训练阶段不输入 RECIST、TVC 结果。

图 2 模型输出分数分层、生存 KM 曲线设计示意图

5.推理策略:测试集样本取 6 折模型输出的中位数作为最终 Serial‑CTRS 得分;建模团队对 GARNET 临床试验结局标签盲态,保证外部验证客观性。

04 实验设置

一、数据集划分

  1. RCP 发现集:1171 例多中心真实世界晚期 NSCLC,用于模型训练调优;
     
  2. RCP 测试集:605 例独立真实世界多中心数据,真实世界外部验证;
     
  3. GARNET 临床试验队列:54 例 dostarlimab 单药治疗 Ⅰ 期临床试验,独立临床试验外部验证。

二、对比基线


RECIST v1.1 实体瘤评价、肿瘤体积变化 TVC。

三、评测任务集合


  1. 主要终点:总生存 OS 预测;单变量、多变量 Cox 回归分析 Serial‑CTRS 与 OS 的关联

  2. 对比实验:Serial‑CTRS 与 RECIST、TVC 的风险分层能力对比,计算 C‑index、Uno‑C‑index;
     
  3. 亚组验证:不同 PD‑L1 表达亚组;RECIST 不同应答亚组(尤其疾病稳定 SD 亚组)
      
  4. 补充评估:预测阳性、阴性预测值;消融、盲态外部数据集验证。


图 3 森林图、各亚组 KM 生存曲线结果汇总图

四、统计方法


Cox 比例风险回归;bootstrap 获取 95% 置信区间;Uno‑C‑index 校正删失数据;Kaplan‑Meier 生存分析。

05 结果与分析

1.整体预后效能:RCP 测试集多变量校正后,Serial‑CTRS 每升高 10 个百分点,死亡 HR=0.74(95% CI 0.70‑0.79);GARNET 试验队列 HR=0.45(95% CI 0.32‑0.65);多变量模型 RCP 测试集 C‑index=0.71,GARNET 队列 C‑index=0.75。   

2.与传统指标头对头对比:无论 RCP 测试集还是 GARNET 队列,Serial‑CTRS 高低风险组风险比均高于 RECIST、TVC,风险分层能力更优。RCP 测试集 Serial‑CTRS HR=6.19,RECIST HR=3.79,TVC HR=4.55。  
3.PD‑L1 亚组结果:在 PD‑L1 阴性、低表达、高表达各个亚组,Serial‑CTRS 的 C‑index 均优于 RECIST 与 TVC。 
4.RECIST 疾病稳定 SD 亚组:针对 RECIST 评估为疾病稳定的患者,Serial‑CTRS 依然可以有效区分高、中、低生存风险,弥补传统标准在该人群分层不足的缺陷。   
5.外部临床试验队列验证:GARNET 临床试验数据集验证依然保持良好预测性能,证实模型可以跨真实世界、临床试验两种场景泛化。 
6.局限相关结果:模型缺少图像可解释,无法明确哪些影像特征驱动预测;部分病例删失比例较高,会影响分数校准。

06 结论

本研究提出 Serial‑CTRS 完全自动化深度学习影像生物标志物,利用基线与 12 周随访时序胸部 CT,预测晚期 NSCLC 接受 ICI 免疫治疗后的总生存。经过真实世界多中心队列、独立临床试验队列双重外部验证,Serial‑CTRS 总生存风险分层性能优于 RECIST、TVC 传统影像指标;在 PD‑L1 不同亚组、RECIST 疾病稳定人群中仍可实现有效分层。该标志物依托常规临床 CT,无需人工病灶标注,具备嵌入临床工作流与肿瘤临床试验的潜力。研究存在局限:模型可解释性不足;部分样本删失率较高;还需要更多多中心前瞻性队列进一步验证。

07 论文评价

✅方法创新亮点

      1.采用全胸范围三维 CT 建模,不局限于肿瘤病灶 ROI,挖掘胸内全部潜在预后信息;整套流程完全自动化,不需要人工勾画病灶,适配常规临床流程。   

      2.严谨的证据链条:真实世界队列建模,同时设置真实世界测试集 + 独立临床试验数据集两套外部验证,提升结果可信度。 
      3.重点针对临床痛点亚组开展分析,尤其是 RECIST 判定疾病稳定、免疫治疗异质性大的人群,模型可进一步风险分层。
      4.直接与临床广泛使用的 RECIST、TVC 做头对头对比,研究结论贴近肿瘤内科、放射科真实临床与临床试验需求。   

      ⚠方法不足

      模型可解释性有限,无法明确是哪些图像特征驱动生存预测;RCP 发现集存在较高生存删失,会影响模型分数校准;模型只利用胸部 CT,无法获取中枢等其他部位转移预后信息;GARNET 外部队列样本量偏小;尚未开展前瞻性临床验证;暂未开发可以直接部署的软件工具。

      08 参考资料

      Article:

      10.1001/jamanetworkopen.2025.55759

      图片
      图文:陈宣辰

      编辑:陈宣辰

      审核:吴朝


      图片

      The Lancet Digital Health(一区|IF=25.5)| 开发并外部验证基于心电图的心血管疾病及结局预测对比学习基础模型
      Nature Medicine(一区 IF=52.5)NeuroVFM:基于卫生系统学习范式的通用神经影像三维视觉基础模型
      npj Digital Medicine(IF=18.0)丨用于肝癌切除后时间解析生存预测的可解释的多模态深度学习方法
      JAMA Network Open(一区,IF=11.7)|机器学习结合分子成像术中检测肺结节恶性风险

      【声明】内容源于网络
      0
      0
      瓴智医学AI
      分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
      内容 83
      粉丝 0
      瓴智医学AI 分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
      总阅读2.4k
      粉丝0
      内容83