大数跨境

在海量序列中打捞异常:AI如何协助发现全新的生物酶系统

在海量序列中打捞异常:AI如何协助发现全新的生物酶系统 AICUG人工智能社区
2026-09-24
2
导读:在数据之间建立新连接,只是迈向科学认知的第一步;真正的知识确立,永远依赖于实验室培养皿中的严密实证。ART系统展现了自然演化中逆转录酶系统令人惊叹的未知复杂性,也为探索生命奥秘打开了一扇新的侧门。

在公共生物数据库庞大的基因长卷里,藏着无数尚未被命名的自然机制。研究者通常依赖预设规则检索已知家族,但许多潜在工具往往以反常形式蛰伏于原始序列之间。近期研究团队借助智能体在噬菌体基因组中定位到特殊结构组合,提出了全新的酶系统假说[1]。

这项被命名为ART的系统,核心特征在于逆转录酶与一段规则排列的非编码串联重复序列紧密相邻。它的科学意义不仅在于为分子生物学库增添了一个值得追踪的天然候选,更在于展现了一种新的探索范式:当计算智能体承担起跨越文献、序列比对与假说提炼的庞大检索后,科学家得以及早锁定那些具备实验跟进价值的复杂机制[2]。

01|从数据库到湿实验的跨越

整个探索始于一个面向大型DNA数据库的高层提示。智能体系统从超过19亿个蛋白质簇中汇集了逾20万条逆转录酶记录,并在此基础上展开多层级特征比对与邻域扫描。经过自动化剔除与聚类,候选范围收窄至3,500个值得审视的新系统,最终仅有20个高价值候选被整理为结构完整的分析报告,交由人类科学家评阅[1]。

在这一计算搜索阶段,大约950个智能体实例在21小时内协同运转,共消耗约2.1亿个词元。需要指出,这21小时仅代表前期的计算数据挖掘与报告生成过程,并非包含湿实验在内的全部研究周期;950个智能体也并非全程并发执行,而是根据任务流程动态分派在序列聚类、文献检索与报告起草等环节中[1]。

为了验证这些报告中的假说,Anthropic于2026年春季在湾区自建了生命科学实验室。将计算模型、序列挖掘与实体湿实验整合在同一团队内,避免了纯计算预测缺乏生化反馈的空转。所有物理操作均由人类科学家完成,计算智能体则通过自动化分析为实验设计提供线索,并协助科研人员对后续测序数据进行生化解读[1]。


图1|Anthropic原网页的视频封面,用于介绍其生命科学实验室;所有湿实验由人类科学家完成。此图为实验室场景,不是ART功能验证图。来源:[1]。

02|如何将序列异常转化为候选

逆转录酶是一类以单链RNA为模板合成互补DNA的催化蛋白,在病毒复制与移动遗传元件中扮演着核心角色。传统研究多聚焦于酶分子本身的催化结构域,通过同源比对扩展同类酶序列。然而,在自然演化中,单一蛋白质往往必须与特定的核酸元件或辅助蛋白协同运作,孤立寻找已知蛋白的变体难以揭示真正未知的生物学功能[2]。

此次发现的关键转变在于将目光从孤立蛋白延伸至其基因邻域。智能体在一个此前被归类但机制模糊的逆转录酶家族周围,注意到了未被注释的原始非编码DNA区域。通过定量测算该区域的片段长度与几何间隔,系统确认这里存在规律出现的串联重复序列,并将已知酶与未标记的邻域特征重新关联为潜在的统一单元[1]。

在生命科学领域,发现一个功能系统的意义远大于单纯多找出一个相似蛋白。单独一个具有逆转录活性的酶通常只能提示常规催化能力,但当逆转录酶与规则排列的重复序列以及专属辅助蛋白在基因组中稳定共存时,意味着它们极可能参与某种尚未被阐明的复合生物反应,为后续探索提供了具体的空间线索与机制切入口[2]。

03|ART系统目前确证了什么

这一被命名为ART的系统,在基因组结构上展现出高度特征化的三元组合:一个逆转录酶基因、紧邻其旁的未知功能辅助蛋白编码序列,以及一段由约两百个核苷酸单元构成的长串串联重复阵列。虽然逆转录酶本身在过往测序中已有记录,但这一由多组分共同构筑的邻域架构,此前并未被作为独立生物系统系统性报道[2]。

实验室的初步生物化学检测显示,这些处于非编码区的长串重复阵列并非沉默无用的DNA片段,而是能够被有效转录为多种离散的短RNA分子。短RNA的稳定表达为该系统具有生物活性提供了关键的早期生化证据,表明这些规则间隔的阵列结构在生理状态下极可能发挥某种特异性的核酸介导功能[1]。

规则间隔的重复单元转录为短RNA,在结构构型上很容易让人联想到CRISPR系统的引导机制。这种相似性为研究者提供了有力的探索假说,但必须强调,目前的科学证据仅停留在序列共存与转录物检测阶段。该系统在噬菌体宿主内的确切生理机制尚未阐明,没有任何实验证实其具备核酸剪切或基因编辑功能,不可将其断言为新的编辑工具[1]。


图2|Anthropic原网页展示的DNA重复序列,框选部分呈现Claude注意到的重复模式。序列特征为ART研究提供了线索;其具体功能还需进一步验证。来源:[1]。

04|为什么这种挖掘适合智能体

传统的生物信息学自动化筛选高度依赖预设规则与分类指纹,难以捕获意料之外的结构组合。资深人类专家在深入研读具体基因组时能够敏锐察觉异常,但面对数十亿级的庞大序列库,专家的精力与时间构成了根本瓶颈。预印本明确指出,正是专家深读环节的不可扩展性,限制了冷门自然系统的系统性检出[2]。

智能体在此处展现的并非偶发的语言灵感,而是严密的工具调用与分析闭环。面对海量候选,智能体能够自主编写脚本度量序列重复间距、调取比对算法确认保守性,并快速检索过往文献排除已知假阳性。通过将非结构化的异常特征整合成兼具定量数据与演化证据的可读报告,智能体将专家审阅工作流规模化落地[1]。

在实际运转中,绝大多数由智能体提出的推测会在后续的多重核对中被自我证伪或淘汰。团队的工作机制通常包括利用公共数据复现已知基准,以及对候选假说进行严格批判。大量调查任务可能最终一无所获,唯有能够经受住生化逻辑与演化保守性交叉检验的极少数假设,才具备进入实验室的资格[1]。

05|科研瓶颈向验证环节转移

随着智能体大幅降低了跨数据库挖掘异常模式的门槛,生命科学研究中的短缺要素发生了转移。过去常常受限于假说匮乏与线索发现,而在自动化初筛之后,高质量候选系统的生成速度迅速超越了下游的承载能力。科研的真正稀缺资源,转向了资深科学家的严谨甄别能力以及实体实验室有限的生化验证通量[2]。

面对3,500个初选系统与最终精选的20份报告,筛选标准的设定变得至关重要。研究团队需要将过去模糊的“科研直觉”或“科学品味”转化为明确的评估准则:例如邻域基因在演化上的保守度、重复序列的特异性,以及假说本身的生化可测性。这种标准的显性化使得假说提纯过程更加可追踪与可复现[1]。

尽管展现了高效的挖掘潜力,但这并不意味着模型已经具备了通用的内生科学发现能力。本次工作本质上是在已有自然演化数据库中打捞被忽视的关联,而非从零创造全新的酶分子。科研界尚未形成衡量AI科学发现能力的通用标尺,不能根据一次成功挖掘,就简单推导或夸大其研发成本节约与效率倍数[1]。

06|分层证据与后续验证链条

从科学研究的证据层级来看,目前关于ART系统的确凿事实包含两部分:其一是基因组中逆转录酶、辅助蛋白与串联重复序列的稳定共存;其二是体外或细胞内重复阵列能够转录产生多种短RNA。这两项事实足以确立ART作为一个新酶系统实体的存在,但并不能直接推导出其生理活性与工作机制[2]。

该系统在噬菌体侵染或防御宿主细菌的过程中究竟承担何种角色,仍是完全开放的基础科学问题。逆转录酶是否以转录出的短RNA作为引物或模板?辅助蛋白如何与酶复合体发生空间互作?它针对的目标底物是自身遗传物质还是外源核酸?这些机制问题必须依赖冷冻电镜结构解析与严格的体内敲除实验逐一回答[2]。

回顾分子生物学历史,限制性内切酶、Taq酶与CRISPR最初均源于对微生物异常生理机制的探索,但从发现自然现象到发展为成熟的分子工具,无不经历数十年的工程改造与机制厘清。学术界对ART系统抱持浓厚兴趣,在于其拓展了逆转录酶系统的生物学边界,而非它立刻能作为基因编辑或治疗方案使用[1]。

07|人机协作界面的重新划定

这项研究清晰勾勒出计算系统与人类科学家在科研前沿的新型分工形态。智能体凭借对海量序列与非结构化文本的综合处理能力,承担起广阔搜索空间中的异常定位、证据拼合与初级报告撰写;而人类科学家则在起始端提供战略提示,并在末端承担假说审核、实验方案制定与最终结论的逻辑把关[1]。

计算生成的报告无论在逻辑上多么自洽,都不能替代生物实体的真实反应。生物系统的复杂性决定了纯计算推断存在大量无法事先预知的生化干扰与假阳性。因此,将实验验证的权重置于核心地位,并依赖全球独立同行的重复与结构表征,依然是检验科学发现有效性的唯一金标准[2]。

外界常容易将此类进展概括为“AI替代科学家”,但论文与实际过程表明,AI并未接管实验室,更未独立完成科学研究的全貌。相反,高级科研人员的生物学经验与批判性思维在甄别优质假说时变得前所未有的关键。智能体改变的是科学线索被发现的速率,而非科学验证所需的严谨态度[1]。

浩瀚的自然基因组宛如一座未被充分阅读的图书馆,海量的核酸序列早已安静沉淀在公共服务器之中。以往受限于人工审阅视野,散布在不同物种角落的非典型模式难以连缀成网。当智能系统得以不知疲倦地梳理邻域关联、拉通跨学科证据时,那些原本被视作背景杂音的异常,终于显露出其隐藏的内在秩序[2]。

在数据之间建立新连接,只是迈向科学认知的第一步;真正的知识确立,永远依赖于实验室培养皿中的严密实证。ART系统展现了自然演化中逆转录酶系统令人惊叹的未知复杂性,也为探索生命奥秘打开了一扇新的侧门。在广袤未知的生物世界面前,严谨的求证与耐心的解构,依然是人类科研探索最核心的底色。

资料来源

[1] Anthropic新闻原文,2026年9月23日
https://www.anthropic.com/news/claude-discovers-novel-enzyme-system

[2] 研究预印本:Autonomous AI agents discover reverse transcriptases with tandem repeat arrays
https://www-cdn.anthropic.com/22573675ada52a8ca8a97a1a4b4326b2f208a071.pdf

推荐阅读

1.20K-40K!深圳扬奇医芯招双目结构光算法工程师

2.AI教父Hinton诺奖演讲首登顶刊!拒绝公式,让全场秒懂「玻尔兹曼机」

3.GitHub没了?CEO辞职,微软接管,开发者天塌了

4.AI颠覆数学研究!菲尔兹奖得主、华裔数学家领衔11篇顶刊论文|陶哲轩转赞

5.AI OS,下一个二十年的超级平台

6.全球首个IMO金牌AI诞生!谷歌Gemini碾碎奥数神话,拿下35分震惊裁判

【声明】内容源于网络
0
0
AICUG人工智能社区
专注于AI、智慧医疗、智能制造等产业化前沿技术分享。2018年发起于杭州,19年在硅谷设立分部。累计在北京、杭州、上海、硅谷多地举办近百期沙龙,连续三届举办千人规模AI Pioneer 大会。覆盖全球上万名技术开发者。
内容 550
粉丝 0
AICUG人工智能社区 专注于AI、智慧医疗、智能制造等产业化前沿技术分享。2018年发起于杭州,19年在硅谷设立分部。累计在北京、杭州、上海、硅谷多地举办近百期沙龙,连续三届举办千人规模AI Pioneer 大会。覆盖全球上万名技术开发者。
总阅读5.7k
粉丝0
内容550