RNA-seq之后,怎么从几千个差异基因找到值得做机制验证的候选?
从全局差异、独立重复到功能干预与依赖性验证,逐层压缩候选范围。
RNA-seq 给出的是一张包含数千个差异基因的候选清单。
筛选任务,是把“有差异”逐步转化为“与问题相关、能够稳定重复、可以影响表型,并具备方向性与依赖性证据”的机制验证优先候选。
CANDIDATE FUNNEL / 候选漏斗
差异基因 → 生物学相关候选 → 稳定重复候选 → 功能性候选 → 机制验证优先候选
PART A / 筛选逻辑
研究内容
首先对RNA-seq获得的差异表达结果进行系统整理,结合研究所关注的表型、疾病过程或处理效应,判断哪些变化与当前科学问题具有更直接的生物学联系。通过GO、KEGG、GSEA等功能富集分析识别发生稳定改变的生物学过程和功能模块,并结合基因表达丰度、差异方向、重复间一致性及通路内多个成员是否呈协同变化,对大规模差异基因进行初步压缩。该部分拟将“几千个差异基因”转化为若干与研究表型相关的功能模块和候选基因集合,为后续机制候选排序提供基础。
在初步候选集合基础上,进一步评价不同基因与目标表型之间的关联强度及其潜在调控价值。结合样本间基因表达与关键表型指标的相关关系、共表达网络、蛋白互作网络及候选基因在功能模块中的位置,判断其是否处于能够连接多个变化节点的潜在调控位置;同时结合已有文献、公共数据库以及研究体系中的已知生物学背景,区分“已有充分研究的伴随变化”“具有一定依据但在当前体系中尚未验证的候选机制”以及“主要由本研究数据新提示的候选”。通过多维证据整合形成候选优先级,从而得到数量有限、具有明确验证价值的候选基因。
对优先级较高的候选基因进行独立验证,确认RNA-seq中的变化是否能够在不同样本、独立实验或其他数据层级中重复观察。根据候选分子的性质,采用qPCR、Western blot、免疫检测或独立队列分析等方式验证其表达变化,并进一步分析候选基因变化与目标表型之间是否具有一致关系。必要时结合其他公开转录组、单细胞数据、蛋白组数据或临床样本信息进行交叉验证,以判断该候选是否仅为某一批RNA-seq样本中的偶然差异,还是能够稳定伴随目标生物学过程变化。该部分获得的是候选基因与研究表型之间的稳定关联证据。
针对经过多维证据排序和独立验证后的候选基因,采用基因敲低、敲除、过表达或药理学干预等策略,直接观察候选基因改变后目标细胞行为、疾病表型或功能指标是否发生相应变化。对于多个候选,可先采用规模较小的功能筛选比较不同候选对核心表型的影响强度和稳定性,再选择能够产生可重复功能效应的候选进入深入研究。通过这一过程区分“随表型变化的差异基因”与“能够实际影响表型的功能性候选”,从而进一步缩小后续机制研究范围。
对于具有稳定表达变化且功能干预能够影响目标表型的候选,进一步判断其是否位于研究过程中的关键调控链条。分析上游处理因素是否能够稳定调节候选基因,候选基因改变是否进一步影响下游表型,并通过阻断、救援或遗传互作等策略判断目标表型是否依赖该候选基因。若RNA-seq同时提示候选基因可能连接特定下游通路,则进一步检验该通路变化是否依赖候选基因,并排除仅由广泛细胞损伤、应激反应、细胞组成变化等因素造成的替代解释。最终依据“组学提示—独立验证—功能干预—方向性关系—依赖性验证”的证据组合,确定哪些候选具备进入深入机制研究的价值。
PART B / 执行方案
研究方案
-
首先对现有 RNA-seq 数据进行质量复核,确认样本测序质量、样本间一致性、异常样本以及潜在批次效应。结合实验分组重新检查差异表达分析模型是否与原始实验设计一致,避免由于批次、样本组成差异或少数异常样本产生大量表观差异基因。对于存在明确批次或其他混杂因素的数据,在统计模型中进行相应控制。
-
对各基因的差异表达结果进行系统整理,同时记录表达丰度、差异方向、效应大小、统计不确定性以及各生物学重复之间的一致性。优先保留在独立重复中具有一致变化方向、且不是由单一样本驱动的差异基因。
-
以完整基因排序结果开展 GSEA 等基因集层面的富集分析,并结合 GO、KEGG、Reactome 或与课题相关的专业数据库,识别与目标表型或生物学过程相关的功能模块。对于显著富集的功能模块,进一步检查变化是否由多个成员共同贡献。
-
对与核心研究问题相关的功能模块进一步分析其内部基因构成,比较同一功能模块内基因的变化方向、表达水平和重复稳定性,将差异基因从“单个基因列表”重新组织为“生物学过程—功能模块—候选基因”的结构。
-
当样本量和实验设计能够支持网络分析时,可进一步进行共表达模块分析,寻找与核心表型或处理状态显著相关的基因模块;若样本量不足,则不强行进行 WGCNA 等依赖较大样本量的网络推断,以避免得到不稳定的网络结构。
-
本阶段形成第一层候选池。能够进入下一阶段的候选,应至少同时满足:RNA-seq 差异具有基本稳定性;其所在功能模块与研究问题存在合理联系。
A, RNA-seq 候选初筛总体流程,包括样本与数据质量控制、差异表达分析、功能通路与基因模块解析,以及第一层候选池的形成。B, PCA 用于评价样本整体转录组结构、组间差异以及潜在异常样本或批次效应。C, 火山图展示差异表达基因的变化方向、效应大小及统计支持度。D, 代表性差异基因热图用于观察不同生物学重复之间的表达一致性及组间变化模式。E, GSEA 基于完整排序基因列表识别由多个基因共同驱动的生物学过程变化。F, GO、KEGG 或相关功能注释分析用于识别与研究问题相关的富集通路和生物学过程。G, 共表达或功能网络分析将离散差异基因进一步组织为具有共同变化特征的基因模块,并辅助识别与目标生物学过程相关的模块。H, 综合差异表达可靠性、重复一致性、功能相关性及模块支持等信息,对大量差异基因逐级压缩,形成用于下一阶段评价的第一层候选池。图中基因名称、样本量及数值均用于示意分析逻辑。
-
已获得的 RNA-seq 原始数据或标准化表达矩阵 -
完整样本分组信息及实验元数据 -
与课题核心表型对应的实验数据 -
R 或 Python 分析环境 -
差异表达分析工具 -
GO、KEGG、Reactome、GSEA 等功能注释与富集分析资源 -
必要时使用共表达网络分析工具
-
对 2.1 获得的候选基因建立统一的多维评价框架,使候选优先级来自多个相互独立的信息来源。
-
首先评价候选基因与目标表型之间的关系。如果每个 RNA-seq 样本同时具有连续型表型数据,如增殖、迁移、炎症程度、药物敏感性或其他定量指标,则分析候选基因表达与相应表型的样本间关系。若实验只有简单处理组与对照组,而没有独立连续表型,则不能把组间差异重新包装成“表达—表型相关性”。
-
分析候选基因在相关功能模块中的位置。可结合共表达关系、蛋白互作网络以及已知调控网络,判断候选是否可能连接多个与目标表型相关的变化节点。网络中心性只作为辅助信息,因为高连接基因可能同时受到数据库研究偏倚和基础生物学功能广泛性的影响。
-
对候选基因进行已有证据检索和分类。重点区分三类情况:已有充分研究、在类似体系中作用已经较明确的分子;已有一定生物学依据但在当前研究体系中尚未验证的候选;主要由本研究数据新提示、目前机制信息有限的候选。
-
进一步评价候选的实验可验证性,包括是否能够进行可靠的表达检测、是否存在可行的遗传或药理干预方式、其表达水平是否足以稳定测量,以及是否存在明显影响后续实验解释的技术障碍。
-
将候选按照“转录组证据稳定性—与核心表型的关系—功能模块与网络支持—已有生物学依据—实验可验证性”等维度进行综合排序。各维度分别保留原始信息。
-
本阶段的目标是将第一层候选池压缩为适合进行独立实验验证的候选集合。如果一个候选只有显著差异,而缺乏生物学关联、网络支持或可验证性,则优先级降低;如果候选存在多维证据支持,即使其 fold change 不是最大,也可以保留进入下一阶段。
A, 候选优先级评价总体流程,从第一层候选池出发,综合表型关联、网络或模块位置、外部证据以及实验可行性,形成数量有限的优先候选集合。B, 当样本具有独立连续表型数据时,分析候选基因表达水平与核心表型之间的关系,不同候选可表现出不同方向和强度的关联。C, 多维证据矩阵综合 RNA-seq 稳定性、表型关系、模块支持、网络位置、外部数据库、文献依据及实验可行性等信息,用于比较不同候选的证据结构。D, 候选在共表达或功能网络中的位置,用于评价其与目标功能模块之间的联系;网络中心性仅作为候选排序的辅助证据。E, 候选在独立公开数据集中的变化方向及重复情况,用于评价其外部一致性。F, 根据候选与研究涉及的主要生物学过程、疾病背景及已有功能信息评价其生物学相关性。G, 从 RNA、蛋白检测、遗传干预及研究模型适配性等方面评价候选进入后续实验的可行性。H, 综合多维证据形成优先候选短名单,并选择其中证据结构较完整的候选进入独立验证阶段。图中的候选名称、排序及评分均为示意。
-
2.1 获得的候选基因及功能模块 -
与研究表型对应的数据集 -
蛋白互作及调控网络数据库 -
公共转录组、单细胞或其他相关组学数据库 -
文献检索数据库 -
R、Python 或网络分析软件 -
候选证据整理和优先级评价表
-
使用独立于原始 RNA-seq 测序过程的检测方法,对优先候选进行表达层面的验证。对于蛋白编码基因,首先以独立生物学重复检测 RNA 水平;若后续机制推断实际依赖蛋白功能,则进一步检测蛋白水平,避免默认转录本变化一定转化为蛋白变化。
-
独立验证样本优先采用新的生物学样本或独立重复实验,若样本资源有限,可以先在原样本中进行技术确认,但仍应将独立生物学验证作为更高优先级的证据。
-
对候选基因主要关注三个信息:变化方向是否与 RNA-seq 一致;效应是否能够在独立实验中重复;变化是否与研究处理或目标生物学状态保持稳定关系。
-
对于有合适公共数据资源的候选,可使用独立转录组、单细胞转录组、蛋白组或临床样本数据进行交叉验证。此类分析用于增加候选变化的外部重复性。
-
如果公共数据来源包含多个细胞类型,应注意区分“单个细胞内表达改变”与“样本中细胞比例发生变化”。特别是在组织和免疫相关 RNA-seq 中,应避免把细胞组成改变导致的表达变化直接解释为某个细胞内部的调控机制。
-
若候选在独立实验中不能重复原 RNA-seq 的变化,应首先检查原测序数据、样本异质性、批次和检测体系。如果技术有效而变化仍不能重复,则该候选原则上停止进入高成本机制实验。
-
通过本阶段后,候选应从“组学提示的差异基因”升级为“能够在独立实验中稳定重复的候选变化”,这一证据仍然说明稳定关联。
A, 独立验证总体流程。由上一阶段获得的优先候选首先在新的独立生物学样本中进行验证,随后分别确认 RNA 和蛋白层面的变化,并结合外部独立数据评价其跨数据集可重复性,最终筛选进入功能实验的稳定候选。B, 在独立生物学重复中采用 qPCR 或其他适当方法验证候选 RNA 表达变化,重点评价变化方向、效应大小及独立重复之间的一致性。C, 对蛋白编码候选进一步检测蛋白水平,判断 RNA-seq 所提示的转录变化是否能够在蛋白层面得到支持。D, 将本研究 RNA-seq 结果与独立 bulk RNA-seq、公开数据集、蛋白组或其他适用数据来源进行交叉比较,评价候选变化是否能够跨数据来源稳定重复。E, 比较本研究与外部独立数据集中基因表达变化的方向和效应大小,以判断优先候选是否具有跨队列重复性。F, 在存在单细胞数据时分析候选基因的细胞类型表达背景,用于区分单个细胞内的表达改变与细胞组成变化所造成的整体表达差异。G, 综合 RNA 重复性、蛋白支持、外部数据支持及细胞类型可解释性,对候选的稳定证据进行归纳。H, 保留在独立样本及多个数据层级中具有较一致支持的候选,进入下一阶段功能干预筛选;缺乏稳定重复证据的候选不优先进入高成本机制研究。。图中数据、候选名称及排名均为示意。
-
与 RNA-seq 体系一致的独立细胞、组织或其他研究样本 -
RNA 提取与逆转录相关试剂 -
候选基因特异性检测体系 -
实时定量 PCR 仪 -
若需要蛋白验证:蛋白提取、电泳及免疫检测相关试剂 -
Western blot 或其他适合候选蛋白的定量检测平台 -
必要时使用公共组学数据库和生物信息分析工具
-
对通过独立验证的候选进行主动干预,使候选筛选从“相关变化”进入“功能验证”。根据候选分子的性质和研究模型选择敲低、敲除、过表达或其他适合的干预方式,不能机械要求所有候选使用同一种技术。
-
干预实验开始前首先确认干预效率。对基因敲低或过表达同时检查目标 RNA,必要时检查蛋白水平。只有在目标分子确实受到有效干预的条件下,后续阴性表型结果才具有解释意义。
-
对每个候选预先确定与课题核心问题直接相关的主要功能终点。例如课题关注迁移,则主要终点应是能够直接反映迁移行为的指标;若关注治疗敏感性,则主要终点应围绕药物响应。避免因为某些检测方便而同时加入大量与核心研究问题关系较弱的细胞表型。
-
设置与具体干预方式匹配的必要对照,例如非靶向干预、载体对照或相应处理基准。若候选干预可能引起广泛细胞死亡、生长停止或严重应激,应同步评价这些因素,因为它们可能造成目标表型的继发变化。
-
对多个候选采用相同的核心表型评价框架,使候选之间可以比较。重点比较候选干预后目标表型变化的方向、效应大小、重复稳定性以及是否伴随明显的非特异性细胞损伤。
-
对 RNAi 等可能存在脱靶问题的策略,关键候选应使用独立干预序列或其他正交干预方式确认结果。若不同干预方式得到相互矛盾的表型,应先解决干预特异性问题。
-
若候选表达变化能够稳定重复,但有效干预后目标表型不发生可重复改变,则该候选更可能属于伴随性变化,而非当前表型的重要功能节点。
-
经本阶段筛选后,保留能够在技术有效条件下稳定影响核心表型的少数候选进入下一阶段。
A, 功能干预筛选总体流程。对通过独立验证的候选采用适当的遗传或其他主动干预策略,在确认干预有效的基础上检测课题相关核心表型,并结合特异性及非特异性损伤评价筛选功能候选。B, 候选干预效率验证,用于确认目标 RNA 或蛋白确实受到有效调节,是解释后续表型结果特别是阴性结果的技术前提。C, 对多个候选采用统一的核心表型评价框架进行初步比较,同时记录能够辅助解释表型变化的相关信息。D, 使用独立干预序列或正交干预方式比较候选效应的一致性,用于评价功能效应的可重复性并降低脱靶效应造成的误判。E, 代表性功能实验展示强功能候选与弱功能候选在主动干预后的不同表型效应。F, 将核心表型变化与细胞活力、毒性或其他非特异性损伤指标分别评价,以区分目标功能变化与广泛细胞损伤导致的继发表型。G, 综合干预效率、核心表型效应、正交重复性及非特异性毒性,对不同候选进行保留或淘汰。H, 保留在有效干预条件下能够稳定改变核心表型且缺乏明显非特异性解释的候选,作为进入方向性与依赖性验证的功能性候选。图中候选、效应值及统计结果均为示意。
-
与课题一致的细胞或其他可干预研究模型 -
siRNA、shRNA、CRISPR 系统、表达载体或与候选相适配的其他干预工具 -
转染、转导或其他基因操作相关试剂 -
候选基因 RNA 和蛋白检测体系 -
与核心表型对应的功能检测平台 -
细胞状态或细胞损伤评价试剂 -
细胞培养设备及相应检测仪器 -
图像或定量数据分析软件
-
对 2.4 获得的功能性候选进一步建立“上游研究因素—候选基因—核心表型”之间的方向性关系。首先在适当时间结构下观察上游处理因素发生变化后,候选分子的变化是否稳定出现,并结合目标表型发生的时间顺序,判断候选变化是否具有作为中间环节的时间合理性。
-
主动改变候选基因后再次检测核心表型,确认 2.4 得到的功能关系能够稳定重复;必要时同时检测 RNA-seq 所提示的相关下游功能模块,判断候选干预是否能够改变这些下游变化。
-
若研究准备支持“上游因素通过候选基因影响目标表型”,应设置依赖性实验。其基本结构是判断改变候选能否改变上游因素对目标表型产生的效应。
-
根据候选及模型特点,可采用救援、反向干预、双因素干预或其他适当的遗传互作设计。例如在上游因素产生目标表型的背景下反向调节候选,观察目标表型是否被削弱、恢复或重新改变;具体采用何种方式由候选分子的正常调控方向和实验体系决定。
-
如果候选基因本身的干预能够影响表型,但改变候选不能改变上游处理对表型的效应,则目前证据更支持候选与表型存在独立功能关系,而不足以支持其是上游效应的必要中介。
-
如果 RNA-seq 或其他证据进一步提示候选可能作用于特定下游通路,应先验证候选干预是否改变该通路,再判断阻断或恢复该下游环节是否改变候选对目标表型的作用。只有后者成立,才逐步建立“候选—下游环节—表型”的依赖关系。
-
对主要替代解释进行针对性排查。例如候选干预是否主要通过严重细胞毒性、普遍应激、细胞周期停滞或细胞组成变化间接造成目标表型差异。只针对能够实际解释当前现象的替代机制增加实验,不做无边界的通路排查。
-
只有当候选同时具有稳定组学证据、独立重复证据、功能干预证据以及与上游效应相关的依赖性证据时,才优先确定为值得进入更深入分子机制研究的候选节点。
-
若候选只通过其中部分证据,则按照实际证据重新定位:可以保留为稳定生物标志物、功能相关因子或潜在调控因子,但不直接做为已经确定的作用机制。
A, 方向性与依赖性验证总体流程。从功能性候选出发,依次分析候选变化与核心表型之间的时间顺序、上游因素对候选的调控、候选对上游效应的依赖性以及潜在下游功能联系。B, 时间序列分析比较上游处理后候选分子和核心表型的动态变化,用于评价候选变化是否在时间上具有作为中间环节的合理性。C, 检测上游研究因素改变后候选表达或活性的变化,建立“上游因素→候选”的方向性证据。D, 通过双因素干预、反向干预、阻断或救援设计,判断改变候选是否能够改变上游因素对核心表型产生的作用,从而检验该效应是否依赖候选。E, 代表性核心表型实验及其定量结果,用于比较单独上游处理与联合候选干预后表型效应的变化。F, 当已有数据提示候选连接特定下游功能模块时,进一步分析候选干预后相关下游分子、通路状态及功能读出的变化。G, 综合时间先后、上游响应、候选功能效应、依赖性证据、下游联系及主要替代解释,对不同候选的机制支持程度进行评价。H, 只有同时获得稳定组学证据、独立重复证据、功能干预证据以及方向性和依赖性支持的候选,才优先进入更深入的分子机制验证;仅获得部分证据的候选应按照其实际证据强度定位为稳定相关因子、功能相关因子或潜在调控节点,而不直接定义为已证实机制。图中的候选关系及数据均用于示意实验设计逻辑。
-
2.4 筛选获得的优先功能候选 -
上游处理或研究因素对应的实验体系 -
候选基因正向和反向干预工具 -
必要的双因素或救援实验材料 -
核心表型检测平台 -
候选及相关下游分子的 RNA、蛋白或功能检测体系 -
细胞培养及相应分子生物学实验设备 -
数据分析与统计软件
PART C / 证据路线
总技术路线
↓
↓
↓
↓
↓
↓
↓
↓
↓
↓
↓
↓
FINAL CHECK / 最终判断
整个过程中,候选基因的身份依次发生变化:差异基因 → 生物学相关候选 → 稳定重复候选 → 功能性候选 → 机制验证优先候选。
RNA-seq 本身完成的只是第一阶段的候选发现,最终是否“值得做机制”,取决于后续独立重复、功能干预和依赖关系能否逐层成立。
RNA-seq 只完成候选发现。是否值得继续做机制,要看独立重复、功能干预和依赖关系能否逐层成立。

