大数跨境

自建26TB数据集,加州大学圣地亚哥分校团队提出MitoSpace,解码线粒体四维时空表型图谱

自建26TB数据集,加州大学圣地亚哥分校团队提出MitoSpace,解码线粒体四维时空表型图谱 HyperAI超神经
2026-09-30
5

作者:哇塞

编辑:李宝珠

转载请联系本公众号获得授权,并标明来源


线粒体形态与功能的关联是细胞生物学的基础科学问题。线粒体并非固定不变的静态结构,它可以通过持续裂变、融合和运输实现动态重塑;更重要的是,这些形态变化正是细胞响应自身需求、匹配细胞功能状态的关键,其稳态失衡参与着包括代谢疾病、癌症、神经退行性疾病及衰老等多种生理病理过程。因此,线粒体形态本身便是表型筛选的重要观测指标。


随着电子显微镜技术的发展,科学家们已经定性观察发现其形态与能量状态有关,但在单细胞层面、多种药物扰动下定量证明这一关系仍极具挑战。其原因主要来自两个方面:首先是难以获取高时空分辨率线粒体数据。现有大规模公共筛选数据集如 JUMP-CP、RxRx3 等,依赖固定细胞二维静态图像;共聚焦显微镜虽能捕获三维图像,但易引起严重光毒性、光漂白;其次是难以从超高维图像数据提取有效表型。传统表型分析依赖人工预定义图像特征,既往深度学习方法虽然改进了特征提取,但却也多依赖标注数据或预设生物特征,无法捕捉复杂高维数据的内在异质性。


针对于此,加利福尼亚大学圣地亚哥分校的研究团队结合晶格光片显微镜(LLSM)和自监督对比学习(SSL),构建一套自监督对比学习框架。LLSM 可实现高分辨率(约 100 nm/像素)活体细胞成像,完整捕获细胞内线粒体结构与动态行为;SSL 无需依赖人工注释,能够直接从数据中学习特征表示。基于该框架,研究人员在药物扰动的四维线粒体数据集上训练得到了模型 MitoSpace,无需人工标注,仅通过线粒体时空形态信息就能预测膜电位。


同时 MitoSpace 既能对训练阶段未见过的药物扰动完成零样本推理,也可以迁移应用到人类肺类器官这一陌生生物体系,具备用于四维高内涵药物表型筛选的应用潜力。


相关成果以「4D spatiotemporal landscape of mitochondrial phenotypes across cellular states unlocked through representation learning」为题,发布于 Cell。


研究亮点:

* 无需人工注释,自监督模型即可解析药物扰动下的 4D 线粒体表型 

* 学习得到的表征,可通过线粒体形态和动力学特征预测线粒体膜电位
* 预训练模型可泛化至训练集未出现的扰动,以及人类肺类器官开展表型分析



论文地址:
https://www.cell.com/cell/fulltext/S0092-8674(26)01001-9

构建最大原生四维线粒体成像数据集之一

本研究一改过往大规模数据集信息缺失的弊端,在二维图像信息基础上整合空间和时间维度的信息,进而呈现出完整的线粒体形态和运动行为,为模型训练提供了信息更为全面且具有更强表达能力的数据「口粮」。


具体来说,研究人员首先创建了一个包含广泛药物诱导线粒体表型反应的影像数据集(如下图所示)。数据集内细胞类型采用了 Cal27 人类头颈癌细胞(加州大学圣地亚哥分校提供);药物方面设置 25 种小分子/多肽和 DMSO 溶剂对照,合计 26 组实验处理条件从多条通路扰动线粒体。细胞成像在药物预处理 2 小时后开始。



高分辨率四维成像捕捉多种药物扰动的线粒体表型


成像设置方面,研究人员针对每个条件采集 10 处独立成像区域,单个区域物理体积为 13 × 170 × 756 μm(z,y,x),包含约 150 个细胞。为了同时追踪线粒体结构和功能,研究人员采用 MitoTracker Green FM 和 TMRM 荧光剂对细胞进行染色,然后按照每分钟采集一套完整三维图像为条件,对每个区域连续成像 20 分钟。该时间间隔和持续时长,有利于保证线粒体充足的运动时间,并且最大限度减少染料的光漂白。最终获取到的药物扰动 LLSM 数据集总量为 26TB。


随后,为提取单细胞大小的样本以训练模型,研究人员对原始数据集开展进一步预处理。针对每种条件提取约 1,500 个单细胞四维影片,整个单细胞数据集包含约 40,000 个单细胞。每个单细胞通过两个通道获取,跨越 60 个 z 平面和 20 个时间节点(20,2,60,256,256;t,c,z,y,x),合计 10⁸ z 平面,单细胞数据集总量达到了 12TB。这已经是系统性药物扰动下生成的规模最大的四维线粒体成像数据集之一。


在模型泛化能力评估实验中,研究人员为验证 MitoSpace 的跨生物模型泛化能力,再次构建了一个全新的基于人类肺类器官(LO)发育的独立四维数据集(使用 STEMdiff 分支肺类器官试剂盒制备,细胞是内源标记的人诱导多能干细胞 hiPSC,线粒体带 TOMM20-mEGFP 荧光标签、细胞膜带 CAAX-mTagRFP-T 标签)。人类肺类器官可以在体外模拟肺发育全过程,该数据集覆盖从多能干细胞(SCs)、定型内皮层(DE)到早 / 中 / 晚各成熟肺类器官结构不同发育过程。


本研究中所涉数据集均使用 LLSM 采集完成,该设备是 HHMI Janelia/加州大学伯克利分校 Eric Betzig 实验室提供的自研定制晶格光片系统,激发物镜为 0.6 NA,探测物镜为 1.0 NA。另外系统内还改进使用了 ORCA-Fusion BT CMOS 相机,以 59 × 倍率拍摄。在光片参数方面,六边形晶格光片(NA 范围为 0.35-0.40)相比多贝塞尔晶格光片也具有更好的轴向分辨率。


不同的是,针对药物诱导线粒体表型反应的影像数据集,四维数据采集方式通过载物台连续移动扫描,步长为 0.3 μm,单帧曝光时间为 25 ms。单个时间点采集 2401 张扫描图像,一共 20 个时间点,时间间隔为 1 分钟;针对 LO 独立四维数据集,只采集线粒体随时间变化的结构信号,而未采集 TMRM 膜电位通道。每个发育阶段至少 3 个成像区域,单区域成像时长为 10 分钟,体积帧间隔为 10.7 s。


为满足 MitoSpace 的输入需求,单细胞体积重采样固定空间尺寸为(60,256,256;z,y,x)。模型使用 BiLSTM 编码器处理时间序列,完整保留全部 60 个时间帧,取最后一层的最终隐藏状态代表完整的时间上下文,得到每个单细胞样本 2048 维潜在表征。

搭建时空对比学习 pipeline

大规模 LLSM 四维线粒体数据体量巨大,单细胞单通道样本即可达到 150 MB,直接训练会遇到磁盘输入输出瓶颈和内存限制,因而无法直接训练自监督模型。为此,本研究专门为大规模四维时空数据量身定制了一套基于深度学习的时空对比学习 pipeline,包括一个三维空间自编码器、一个四维编码器、自监督对比学习和下游轻量探测头(probe)(如下图所示)。



基于 LLSM 数据的自监督深度学习解析线粒体药物反应时空景观


首先,针对四维数据的预处理压缩,研究人员自研了三维空间自编码器,包含两个组成部分:编码器网络通过堆叠的三维卷积层组成,将三维体积(1,60,256,256;c,z,y,x)压缩为(2,15,64,64;c,z,y,x);解码器通过一系列转置的三维卷积层实现,从压缩表示中重建三维体积,反向映射编码器的架构。利用复合重建损失函数压缩每一个三维帧,实现 16 倍数据压缩,在最大程度上保留关键空间信息前提下降低输入输出压力,同时支撑分布式大规模训练。


其次,为提取时空嵌入,研究人员开发了包含空间编码器和时间编码器的四维编码器,用于提取每个时间点上线粒体三维体积形态特征。空间编码器由 3D residual network(3D ResNet)模块组成,逐时间帧独立处理每个三维体积,并将每一帧编码为 2048 维特征矢量;帧级嵌入序列随后传递给时间编码器,时间编码器采用多层双向长短期记忆网络(BiLSTM)堆叠实现,用于建模序列内的时序依赖关系。


为实现无标签训练,使表型相近样本在隐空间聚集、差异样本相互远离,研究人员通过视觉表征对比学习 SimCLR 实现(采用 InfoNCE 对比损失,最大化同一样本两个增强视图表征相似度)。在训练过程中,每个解码后的四维样本都被传递到时空增强模块,生成两个增强视图。四维数据中的三个空间维度通过三维几何变换得到增强,包括旋转、仿射、裁剪、翻转、加噪、模糊等三维几何/像素增强;为鼓励模型学习线粒体动力学的时间特征,时间维度通过随机时间切片掩蔽进行增强,所有增强均随机且独立地应用,激活概率从均匀分布中抽样,形成组合上较大的增强空间。


最后,在推理阶段预训练好的四维编码器将会被冻结权重,并直接应用于原始未压缩的四维图像,输出嵌入可用于后续各类下游生物表型任务和分析。另外值得注意的是,这一阶段中,MitoSpace pipeline 中的三维自编码器解码器、增强模块和投影头会全部移除,直接输入原始未压缩的四维体积(经最小-最大归一化)给四维编码器,以防止下游任务数据污染。

提供形态-功能紧密关联依据,助力细胞生物学加速发展

研究首先对 MitoSpace 的判别能力进行了定量评估,方法是通过使用标准的距离加权 K-nearest neighbor(k-NN)直接对嵌入进行药物身份预测。结果显示,在 26 种条件下其平均预测准确率为 74.67%,相比之下,仅使用人工预定义 13 个线粒体形态/动力学特征做同样 k-NN 分类的基线对照准确率仅为 23.81%,MitoSpace 学习得到的表征相比手工特征分类精度提升了 50.86%。


随后研究评估了 MitoSpace 捕获信息的能力,方法是利用 GPU 加速版 MitoGraph 提取线粒体网络的空间特征,结合多线程 MitoTNT 管线提取时序形态特征,合计得到 13 项定量指标(如下图所示)。



四维自监督深度学习创建语义结构化的潜在空间


结果显示,对 2048 维嵌入做 PCA,前 10 个主要成分揭示总方差为 69.33%;计算成分与手工线粒体特征的皮尔逊相关系数,隐空间主要变异轴和线粒体形态、动力学特征高度相关;并且在对全部 2048 维原始嵌入做相关性计算后,排除了 PCA 投影带来的假象。


线粒体生物学中的一个核心原则是形态状态与生物能量功能的紧密关联,为探究模型学到的表征是否捕捉到这一耦合关系,研究使用线粒体膜电位报告探头 TMRM 开展验证。



基于探头的解码揭示了 MitoSpace 嵌入能够捕捉线粒体的形态和功能


结果显示,将单细胞 TMRM 平均强度映射到 UMAP 嵌入,隐空间呈现连续平滑的功能梯度,这表明仅形态和动态的表征已经蕴含线粒体功能信息。为进一步测试这一关系是否足够支持定量预测,研究人员在冻结编码器上嵌入回归探头发现,仅凭学习到的四维时空表征预测平均归一化 TMRM 强度,R²=0.91;全部 26 种药物条件下,预测 NAPE 中位误差保持在一个低水平,介于约 0.5%-5% 之间。


作为对照,使用二元输入生成的嵌入训练等效探头,通过 Otsu 阈值消除荧光强度、纹理信息,其二进制数据的探测结果为 R²=0.74。这证明了线粒体形态与动力学本身携带了大量的生物功能信号,而如像素强度、纹理信息等像素级特征会进一步提升预测性能,是证实线粒体形态与功能具有紧密关联的重要理论依据。同时,实验证实了 MitoSpace 能够生成具有生物学意义的线粒体表征,从而可靠地提取功能信息。


在 MitoSpace 泛化评估中,研究人员首先对未见过药物扰动的零样本泛化能力进行了验证。训练集仅使用 26 种条件中的 10 种,剩余 16 种完全不参与训练。结果显示,零样本条件下 Top-1 k-NN 准确率相比全部条件训练的模型准确率仅略有下降,从 74.67% 降至了 68.37%。



MitoSpace 在保留语义结构的同时所显示的跨药物、跨生物泛化能力


接着研究评估了 MitoSpace 在基于人类肺类器官发育的独立数据集上的泛化能力。结果显示,尽管仅在 Cal27 癌细胞上训练,未进行 LO 特异性训练,MitoSpace 仍在 20% 测试分段中实现了 62.9% 的 k-NN 分类准确率,证明了 MitoSpace 能够跨实验领域推广,保持可解释的生物学关系,并捕捉线粒体形态和动力学的可转移表征。

写在最后

MitoSpace 打破了过往只依靠静态形态给线粒体分类的传统思路,证实了线粒体的形态变化并非简单的「碎片化到融合」一维谱系,而是一套包含形态、运动特征的连续高维表型景观。同时,仅凭四维活细胞成像里线粒体的结构与动态信息,模型就能精准预测线粒体的能量状态。这些工作迈出了构建亚细胞表型基础模型的重要一步,训练好的模型甚至还可以跨细胞系统识别发育过程中的线粒体变化,展现出了强大的泛化能力。


当前,这项研究也仍存在不少待突破的局限。模型目前仅基于单一癌细胞系和有限药物数据集训练,成像的时间分辨率和观测时长也有限,难以捕捉超快瞬时事件与线粒体自噬这类漫长生物学过程。另外, LLSM 高昂的设备成本、海量的四维数据,以及荧光染料本身都可能造成信号干扰,极大限制了它的普及。不过,随着模型、代码及完整数据的开源,后续研究也必将不断完善,有望为未来打造能够解析细胞全貌的多细胞基础模型和助力疾病研究与新药筛选奠定基础。


一键获取 2023—2024 年 AI4S 领域高质量论文及深度解读文章 ⬇️

 往期推荐 

戳“阅读原文”,免费获取海量数据集资源!


【声明】内容源于网络
0
0
HyperAI超神经
解构技术先进性与普适性,报道更前沿的 AIforScience 案例
内容 1380
粉丝 0
HyperAI超神经 解构技术先进性与普适性,报道更前沿的 AIforScience 案例
总阅读13.0k
粉丝0
内容1.4k