大数跨境

跨越7亿年进化距离,KAUST等提出Unify:融合语言模型与基因功能知识,寻找跨物种细胞共性

跨越7亿年进化距离,KAUST等提出Unify:融合语言模型与基因功能知识,寻找跨物种细胞共性 HyperAI超神经
2026-09-28
5
导读:借助AI寻找不同物种的细胞共性

作者:田小幺

编辑:李宝珠

转载请联系本公众号获得授权,并标明来源


沙特阿卜杜拉国王科技大学等机构的研究人员提出了跨物种单细胞整合框架 Unify,将 RNA 表达、蛋白质语言模型提取的信息和大语言模型编码的基因功能知识结合起来,构建跨物种「宏基因(macrogene)」。


单细胞 RNA 测序(scRNA-seq)已经成为解析细胞类型、状态与功能的重要工具,但跨物种比较要复杂得多。漫长的进化不断改变基因序列、功能与调控关系,不同实验之间还存在测序平台、样本处理等技术差异。如何从这些差异中识别真正保守的细胞特征,是比较单细胞基因组学面临的关键问题。

现有方法通常依赖一对一同源基因,或根据蛋白质序列相似性建立跨物种对应关系。但随着进化距离增加,可直接对应的基因越来越少;单纯依赖序列,又难以充分利用已有的基因功能知识。跨物种整合本身也存在一个难题:既要尽可能消除物种和实验带来的技术差异,又不能把真实的生物学信号一并抹去。

针对这一问题,沙特阿卜杜拉国王科技大学(KAUST)等机构的研究人员提出了跨物种单细胞整合框架 Unify。该方法将 RNA 表达、蛋白质语言模型提取的信息和大语言模型编码的基因功能知识结合起来,构建跨物种「宏基因(macrogene)」,再通过对抗学习和多目标优化,在批次校正与生物学信息保留之间取得平衡。实验显示,即使面对进化分化超过 7 亿年的物种,Unify 仍能保持较稳定的整合性能,并可用于跨物种扰动预测和细胞类型进化分析。

相关研究成果以「Unify learns cellular evolution with universal multimodal embeddings」为题,已发表于 Nature Communication。



查看论文:
https://www.nature.com/articles/s41467-026-76230-y

10 组跨物种任务,覆盖 7—110 万个细胞

该研究使用了多组公开单细胞 RNA 测序数据,覆盖从跨属到跨门的不同系统发育距离。核心基准包含 10 组跨物种整合任务,同时在约 7 万至 110 万个细胞的数据规模上测试模型的计算扩展能力。

针对基因功能进化,研究人员使用了覆盖人、猪、恒河猴、食蟹猴和小鼠等 5 个物种的眼房水流出结构细胞图谱,并结合人类—小鼠免疫细胞数据,分析保守、功能分化和功能趋同的基因程序。该研究还构建了一个人类—小鼠基准集:序列上互为最佳匹配、但功能相似度较低的基因,被视为功能分化候选;缺少明显同源关系、功能却高度相似的基因,则被视为功能趋同候选。

跨物种扰动预测使用了两类数据。一类利用干扰素 β(IFN-β)刺激后的小鼠淋巴结数据,预测人类外周血单个核细胞在相同刺激下的响应;另一类利用脂多糖(LPS)刺激后的小鼠巨噬细胞数据,预测大鼠、兔和猪的相应变化。前一个任务在训练阶段完全不提供人类扰动后的表达数据,属于零样本预测。

细胞进化分析的物种跨度更大。研究人员整合了地中海涡虫、斑马鱼、玻璃海鞘、小鼠、人、果蝇和秀丽隐杆线虫 7 个物种的数据,进化跨度超过 7 亿年,最终共有 125 种细胞类型用于重建细胞类型之间的进化关系。

Unify:ESM-2 + LLaMA-2 构建跨物种「宏基因」

Unify 不再把一对一同源基因作为跨物种比较的唯一基础,而是引入了更高层级的宏基因。这样,一些没有直接同源关系、但结构或功能相近的基因,也可以进入同一个比较框架。

每个基因首先获得两类表示。蛋白质语言模型 ESM-2 根据氨基酸序列提取蛋白质相关特征;通用大语言模型 LLaMA-2 则读取基因本体(Gene Ontology,GO)等数据库中的功能描述,将基因功能知识转化为数字表示。研究人员分别在两个表示空间中对基因进行聚类,构建基于蛋白质信息和功能信息的两类宏基因,并根据相似程度确定每个基因对不同宏基因的贡献。

原始单细胞表达数据随后被转换到宏基因空间。跨物种比较也由「两个物种是否拥有同一个基因」,变成「两个物种中是否存在结构或功能相近的基因模块」。

Unify 整体框架

在宏基因表示基础上,Unify 使用对抗式自编码器学习不同物种共享的细胞空间。编码器将宏基因表达压缩为低维表示,解码器负责恢复原始信息;训练时还加入细胞类型分类和物种分类两个目标,使相近细胞类型在不同物种中尽量保持一致,同时削弱物种来源和技术批次对表示空间的影响。

这几个目标之间并不完全一致。物种差异去除过度,真实的生物学差异也可能被压缩;细胞类型信息保留过多,又可能留下较强的物种特征。为此,Unify 采用 MGDA-UB 多目标优化算法,根据训练过程中各个目标的变化动态调整优化方向,而不是预先设定一套固定权重。

训练完成后,模型形成两类互补表示:基础嵌入表示(Unify-basal)保留更细粒度的基因表达变化,对具体基因的变化更敏感;宏基因表示(Unify-macrogene)则更适合描述跨物种共享的整体转录程序。

跨越 7 亿年,进一步预测扰动与细胞进化

该研究首先比较了 Unify 与 SATURN、SAMap、scGen、scVI、Harmony 等多种跨物种单细胞整合方法。评价同时考虑批次校正和生物学信息保留,并按照 40% 批次校正 + 60% 生物学信息保留计算综合得分。

结果显示,从近缘物种到相隔数亿年的远缘物种,Unify 的综合表现整体最高。随着进化距离增加,多数方法性能明显下降,而 Unify 相对稳定。不过,在部分近缘物种任务中,Unify 对连续发育轨迹的保留能力稍弱,说明细胞类型对齐增强后,也可能压缩部分过渡状态。

Unify 与多种跨物种单细胞整合方法的性能比较

在基因功能进化分析中,Unify 同时利用蛋白质和功能信息,区分保守、功能分化和功能趋同的基因关系。在人类—小鼠基准集中,Unify 构建的宏基因显著富集了功能分化和功能趋同基因对,而单独依靠蛋白质信息或功能文本信息,都难以同时识别这两类关系。

在 5 个物种的眼房水流出结构细胞图谱中,模型识别出了 C1QA、C1QB、C1QC、CD74 等经典巨噬细胞相关基因,也发现了序列关系与功能关系并不一致的案例。例如,C1QTNF 家族中的部分旁系同源基因结构相近,功能却已经发生分化;人类 HP 与小鼠 H2-Ab1 的序列相似度较低,但功能表示较为接近。人类—小鼠中性粒细胞数据中,也发现了一些没有直接同源关系、但参与相似生物学功能的基因。

Unify 在 5 个物种的眼房水流出结构细胞图谱中识别保守、功能分化和功能趋同的宏基因

跨物种扰动预测考察的是模型能否把一个物种中的扰动响应迁移到另一个物种。以干扰素 β 实验为例,Unify 只使用小鼠扰动数据和人类未扰动数据,直接预测人类外周血单个核细胞受到刺激后的表达状态。

当预测局限于一对一同源基因时,Unify 与专门用于扰动预测的方法表现接近;扩展到全部基因后,两种 Unify 版本对整体转录组状态的预测准确度显著高于基线方法。利用小鼠脂多糖刺激数据预测大鼠、兔和猪时,也得到类似结果。其中,宏基因表示更擅长捕捉整体转录变化,基础嵌入表示则对具体差异表达基因更加敏感。

Unify 的跨物种零样本扰动预测

最后,研究人员利用 7 个物种的统一细胞表示构建细胞类型进化树。相比 SATURN,两种方法在技术稳定性上接近,但 Unify 构建的树具有更高的生物学重复性。不同物种的神经元形成较为一致的分支,上皮细胞之间的关系也大体符合已知系统发育关系。最终,超过 7 亿年进化跨度的 125 种细胞类型被组织进同一棵细胞类型树。

基于 Unify 构建的 7 物种细胞类型进化树

写在最后

过去,跨物种单细胞比较主要建立在基因同源关系上。Unify 在此基础上又加入了蛋白质特征和基因功能信息,使一些缺少直接同源关系、但功能相近的基因也能被纳入比较。这为远缘物种之间的单细胞分析提供了新的表示方式。


目前,Unify 仍依赖蛋白质语言模型和文本模型本身的信息质量,宏基因的自动功能注释也有待完善,研究对象也主要集中在单细胞 RNA 测序。后续如果能够进一步纳入单细胞染色质可及性测序、空间转录组等数据,其跨物种比较能力还有进一步扩展的空间。

 往期推荐 

戳“阅读原文”,免费获取海量数据集资源!


【声明】内容源于网络
0
0
HyperAI超神经
解构技术先进性与普适性,报道更前沿的 AIforScience 案例
内容 1378
粉丝 0
HyperAI超神经 解构技术先进性与普适性,报道更前沿的 AIforScience 案例
总阅读12.8k
粉丝0
内容1.4k