作者 | 周雅
来源 | 科技行者
DNA 是生命的语言,至今我们并未完全掌握它,一旦掌握,这可能会颠覆我们理解生物学和治疗疾病的能力。
如果把人类基因组写成一本书,它大约有 30 亿个字母,只不过这本书只使用四个字符:A(腺嘌呤)、T(胸腺嘧啶)、C(胞嘧啶)、G(鸟嘌呤)。对于其中的每一个位置,一个字母都有可能变成另外三个字母,简单算下来,人类基因组中可能出现的单个字母替换,大约有 90 亿种。
在人类生命里,哪怕仅仅是其中一个字母被误印、被篡改,都可能引发一系列难以逆转的连锁反应。它可能决定了一个新生儿是否会患无法治愈的罕见癫痫,可能默默左右着一个人到中年是偏胖还是偏瘦,也可能悄悄影响着一个人体内细胞在低氧环境下的存活能力。
更棘手的是规模。
90 亿种可能的变化,不可能依靠实验室逐一测试。更何况,人类基因组中,真正直接编码蛋白质的部分只占大约 2%,剩余 98% 非编码区域曾一度被误称为“无用 DNA",事实上,它们才是控制基因何时启动、启动多大音量的总指挥台,绝大多数复杂的常见病与遗传特征,都藏在这 98% 里。
曾经,医生和生物学家面对病人体内测出的突变,只能一个个手工筛查,如同在无边无际的字母海洋里大海捞针。
而就在刚刚,9 月 8 日,Google DeepMind 正式发布了 AlphaGenome Atlas。这个项目汇集了来自博德研究所、哈佛大学、埃克塞特大学、波士顿儿童医院、斯托尔斯医学研究所等多家科研机构的合作研究。
AlphaGenome Atlas 把人类基因组中 90 亿种单核苷酸变异(即 90 亿种可能的单字母变化),一次性预先算完,做成了一份约 1 PB 的数据集,Google 称,它的体量超过 AlphaFold Database 的 30 倍。任何没有编程背景的研究者,即日起可通过上图免费网站查询。
Google 在官方博客中写道:“正如地图集(Atlas)这个名字是把海拔高度和地理位置等地形特征汇集连接在一起的地图集合一样,AlphaGenome Atlas 绘制了全基因组范围内 DNA 变异的分子效应图谱。”
这可能才是 AlphaGenome Atlas 最值得注意的变化:AI for Science 正在从“模型”变成“基础设施”。
要理解 AlphaGenome Atlas 的颠覆性,不妨先设想一个我们生活中的日常场景:
如果你每次遇到一个生僻字,都必须先打报告、申请资金、建立实验室,耗费几个月时间去研究这个字的读音和造字法,你还能顺畅读完一本书吗?过去的基因病理学,很多时候就在经历这种折磨。
AlphaGenome 这个 AI 模型本身不算新面孔。DeepMind 早在 2025 年 6 月就以预印本形式向学术界公开了它,2026 年 1 月又正式在 Nature 发表论文,同时开源了代码。据 DeepMind 在当时的媒体简报会上披露,来自 160 个国家的约 3000 名研究者,在短短半年内就已经用它开展癌症、神经退行性疾病和感染病相关研究。
AlphaGenome 一次最长可以吞下 100 万个碱基对(DNA 字母)的长片段,同时给出数千项分子层面的预测:DNA 可及性、基因表达强度、组蛋白修饰、转录因子结合等。
尽管 AlphaGenome 模型已经具备预测能力,但研究人员只能针对某个特定的突变,临时写代码、上算力跑一次推理,这不仅门槛极高,更缺乏统揽全局的宏观视野。
而这一次,DeepMind 改变了游戏规则:他们不再让科学家在遇到问题时去临时“推算”,而是直接把整本包含 90 亿种“拼写错误”的字典全部编好,摆在免费开放的网页门户上,任何人都能查阅结果。
在这本厚达 1PB 的超级字典里,DeepMind 植入了四个核心引擎:
其一,分子效应预测(Molecular effect predictions)。它不只告诉你这个突变好不好,而是细致预测它在数百种人体细胞(如神经元、心肌细胞)中,对剪接、表达、结合等成千上万个生化环节的具体扰动。
其二,AVI 评分(AVI score)。如果你不是生物信息学专家,看不懂复杂的生化图表,系统会结合 AlphaGenome 的调控预测与 AlphaMissense 的蛋白预测,把所有复杂效应浓缩成一个统一的分值。无论这个突变发生在占 2% 的蛋白编码区,还是发生在占 98% 的非编码调控区,AVI 都能给出一个直接反映其致病潜力的“破坏力危险指数”。
其三,AVI 特征归因(AVI feature attributions)。每个 AVI 评分还与它背后的独特生物学特征相连接,例如由 AlphaGenome 预测的基因调控各个层面,或来自 AlphaMissense 的蛋白质影响评分。
其四,DNA 序列基序(DNA sequence motifs)。Atlas 还收录了超过 2500 个重复出现的 DNA 序列(基因组的“词汇”)及其具体位置。
这套工具能发挥什么作用?三个真实故事,给出了最具冲击力的答案。
故事一:多年未解的癫痫,AI 从数百万嫌疑变异中锁定“元凶”。
在临床医学里,最棘手的场景之一莫过于罕见病。一名癫痫性脑病患者反复遭受病痛折磨,家人做完全基因组测序,报告上列着无数个与常人不同的未知突变,哪一个才是真正的元凶?在过去,医生只能对着屏幕叹气。
来自博德研究所(Broad Institute)的 Laura Covill 和 Anne O'Donnell-Luria,与 GREGoR 罕见病研究联盟合作,把这些「死案」重新扔进了 AVI。
AVI 在嫌疑变异中,锁定了 DNM1 基因上的一个微小突变,这个基因在神经科学领域早已被确认与严重的癫痫性脑病相关,但这次的具体变异在过往的排查里被漏掉了。
它为什么会被漏掉?AVI 背后的归因作出解释:这个字母突变的位置,本身并不直接改变蛋白质的核心结构,它伪造出了一个假的 RNA“剪接位点”。细胞在读取 DNM1 的基因蓝图时被这个假信号误导,把一段本不该出现的多余序列拼进了 mRNA 里,最终合成出一条被异常拉长的畸形蛋白质。
湿实验团队根据 AI 的这套推演设计生化实验,结果证实了这一解释,并在附近找到了效应类似的其他变异。团队据此重新划定了这个变异的临床分类。
由此一来,一次原本需要一个团队耗费数月的无望筛查,被 AI 快速侦破。
故事二:5.4 万人的体检报告,破译我们为何衰老、肥胖与缺氧。
如果罕见病离多数人的生活有些遥远,那么衰老、代谢与体重,则是每一个普通人每天都在直面的生命课题。
但研究这些常见特征也不容易。因为在全人群中,海量无害的中性突变,构成了铺天盖地的“统计背景噪音”,那些真正微弱影响你血脂水平或器官衰老的非编码突变,就像在嘈杂的体育场里说悄悄话,统计学模型根本听不清。
英国埃克塞特大学的 Gareth Hawkes 博士,把 AlphaGenome Atlas 的数据接入了英国生物样本库(UK Biobank)中超过 54000 名真实志愿者的全基因组数据中。
他没有采用传统暴力统计的办法,而是先用 AlphaGenome 把那些毫无杀伤力的无害变异当成垃圾邮件直接过滤掉,只把具有相似分子破坏力的稀有变异归拢在一起进行分析。
结果是,在血浆蛋白水平相关性研究里,他多识别出了 22% 的非编码遗传关联,这些信号在没有 Atlas 帮忙之前,会淹没在噪声里。案例中,一个此前包含 526 个原始候选的区域,被 Atlas 缩小到了 4 个变异。
这项研究直接锁定了数个影响现代人生命健康的关键坐标:
- 成功定位了调控 PLA2G7 蛋白的关键非编码变异,这一指标在老年医学中与机体衰老紧密相连;
- 锁定了调控 EGLN1 蛋白的开关,它是维持人体每个细胞在低氧环境下生存的传感器;
- 更引人注目的是,通过锁定全基因组中影响潜力排名前 1% 的极端变异,研究人员还识别出 19 个与 BMI 相关的遗传区域,为进一步研究这些区域如何参与体重调控提供了新的靶点和方向。
故事三:破解造物者的“音量开关”,细胞如何长成它该有的模样?
你是否曾好奇,为什么你眼角膜上的透明细胞,与你心脏里跳动的肌纤维细胞,明明继承着一模一样的一套 DNA 天书,最终表现出来的外观和功能却有天壤之别?
秘密就在于 98% 非编码区里。基因旁边散落着一批“转录因子结合位点”(Motifs),它们就像是安装在基因旁边的开关。如果某种特定蛋白质踩中了这个位点,基因就会被大声朗读;如果错过了,基因就会陷入死寂。
斯托斯医学研究所(Stowers Institute for Medical Research)的 Julia Zeitlinger 和 Melanie Weilert 教授一直在探寻这套神秘的调控语法,利用 AlphaGenome Atlas 中详尽收录的 2500 多个基因组“核心词汇”,跨多种细胞类型作比较,把转录因子分成了两类。
打个比方,一类可以叫“开锁工”,某些转录因子只负责把紧密折叠的染色体物理结构撬开,让基因所在的区域露出来,本身并不改变基因的表达节奏。另一类可以叫“播音员”,只有另外一些转录因子就位后,它们才真正拥有把基因表达音量拧大或关死的权力。
这套基础语法的破译,意味着人类不仅正在学会读懂基因病,更是帮助研究人员进一步理解,同一套 DNA 如何在不同细胞里被“读”出不同结果,以及基因调控的基本规则究竟是什么。
由此可见,AlphaGenome Atlas 的问世,标志着 AI for science 告别了“猜谜”的传统阶段。
如上文所述,即日起,AlphaGenome Atlas 免费开放学术使用,同时接入 DeepMind 的 AlphaGenome API,并作为一个 skill 集成到 Google Antigravity。DeepMind 未给出 Google Cloud 商用版本的具体上线时间。至于基础模型 AlphaGenome 本身,早已在 GitHub、AlphaGenome API 和 Cloud Model Garden 三处对学术免费开放。
Atlas 不是 DeepMind 在这个夏天的孤立动作。就在几天前的 9 月 3 日,DeepMind 上线了 WeatherNext 3,一个用真实卫星数据训练的全球天气预测 AI 模型,可每小时刷新一次,精度达到 5 公里,它已经接入 Google 搜索、Gemini、Google 地图、Google Cloud。从 2022 年扩容后的 AlphaFold 数据库把可用蛋白结构从 19 万个实验测定条目扩到 2 亿多条预测结构,到 WeatherNext 3 让全球任何一个角落都能拿到 5 公里精度的每小时天气预测,再到今天覆盖 90 亿 DNA 变异的 AlphaGenome Atlas,DeepMind 正在把 AI for Science 的模型推向真实世界的基础设施。
或许在未来,当人类接受全基因组测序时,医疗人员或科研人员手中将不再是一堆毫无头绪的字母代码,而是一张自带精准导航的透视图。
那本曾经无比晦涩的人类基因组天书,正被 AI 一页页翻译成能被临床读懂、被科学干预的现代医学说明书。
科技行者团队出品


