Anthropic公布了一项由Claude参与的生物学发现:约950个Claude Agent在21小时内完成一轮大规模序列搜索,共消耗约2.1亿Token,从超过20万个逆转录酶(RT)序列/实例中筛出约3500个新候选系统,再缩小到20个重点候选。最终,一个Agent在其中发现了一组与逆转录酶相邻、规律排列的DNA重复序列。
研究团队随后继续分析并完成实验室验证,将这套此前未被表征的系统命名为ART(array-associated reverse transcriptases)。
ART的重复序列布局与CRISPR系统有相似之处,但这并不意味着它已经是一套新的基因编辑工具。现阶段可以确认的是:这组repeat array会表达成一组短RNA;至于ART在噬菌体中的主要生物学功能、能否被编程、是否具备DNA切割或编辑能力,目前都还没有答案。
这项工作的看点不在“AI证明了一个新生物学理论”,而在于它把一个过去主要依赖专家逐个筛查的搜索问题,扩展成了可以并行运行的大规模Agent任务。
01从20万个RT开始,最后只留下20个候选
逆转录酶(Reverse Transcriptase,RT)能够以RNA为模板合成DNA。它们广泛存在于病毒、移动遗传元件以及多种基因组系统中,也是分子生物学中非常重要的一类酶。
Anthropic团队这次并不是从一个已知的ART系统开始研究,而是先让Claude Agent大规模搜索RT。
按照Anthropic公布的工作记录,这一轮流程大致可以压缩成:
约950个Claude Agent在21小时内完成这一轮搜索,共使用约2.1亿Token。
这些Agent并不只是做关键词匹配。它们会读取候选RT周围的基因组区域,比较邻近基因、非编码序列和重复结构,再结合文献判断某个模式是否已经被研究过。
在一个候选系统附近,Claude注意到了一串规律排列的DNA重复序列,并继续统计repeat数量、比较间距、检查相邻基因,再检索已有论文。这个组合最终被提交给人类研究人员进一步分析。
这组数字比“950个Agent”本身更能说明AI在这类科研任务里的位置:它的优势不是替代实验室,而是把一个专家很难穷举的搜索空间快速缩小到少量值得做湿实验的假设。
02Claude看到的是一整套重复结构
ART并不是单独发现了一颗新的逆转录酶。
真正引起注意的是几种特征同时出现:
-
一个逆转录酶; -
邻近的伴随基因; -
一串规律排列的非编码DNA重复序列; -
这些结构在多个候选基因组中呈现相似布局。
这种“酶 + 邻近基因 + 重复阵列”的组合,让它看起来不像普通孤立基因,而更像一个完整的生物学系统。
CRISPR同样具有重复序列阵列,因此Anthropic在标题中使用了“CRISPR-like repeats”这一说法。
但这里的“CRISPR-like”指的是重复序列的组织方式存在相似性,不是说ART已经拥有CRISPR那样已知的适应性免疫或可编程DNA编辑功能。
目前最稳妥的表述仍然是:
Claude发现了一套带有CRISPR样重复结构的、此前未被表征的逆转录酶相关系统。
至于它为什么会拥有这样的repeat array,以及这些repeat在噬菌体生命周期里具体做什么,还要等后续功能实验。
03AI负责找线索,实验室负责结果
“Claude发现ART”很容易被理解成模型独立完成了整项科学发现。
实际流程要拆开看。
Claude Agent主要完成了大规模数据库搜索和候选分析,包括:
-
收集RT; -
对不同RT家族进行分类; -
分析邻近基因; -
搜索异常重复序列; -
统计repeat和间距; -
检索文献; -
生成候选系统报告。
研究人员随后对候选结果进行人工复核,并完成实验室验证。
初步实验显示,ART中的repeat array确实会被表达,形成一组短RNA。这说明Claude找到的并不是数据库里偶然排列出来的一段“看起来像重复”的序列,而是一个具有实际生物学活动的系统。
但这一步仍然没有回答ART究竟做什么。
目前还不知道:
-
这些短RNA的靶标是什么; -
RT在系统中的具体作用; -
伴随蛋白承担什么功能; -
ART是否参与噬菌体防御; -
是否可以被人工编程; -
是否存在DNA切割或编辑能力。
因此,这项发现现在更接近:
找到了一套新的生物学机器,并确认它确实在运行。
至于这台机器的用途,还在拆解。
04为什么这类任务适合Agent并行
传统基因组挖掘并不是简单搜索一个motif。
研究人员通常需要同时判断:
-
某个蛋白属于什么家族; -
上下游基因是什么; -
是否存在保守结构; -
非编码区域有没有规律; -
类似系统是否已经出现在论文里; -
候选是否值得进一步实验。
单个候选并不一定复杂,但候选数量一旦达到几十万,人工逐一分析就会变得非常慢。
Agent比较适合处理的,正是这种:单个任务需要一定推理,但可以被大规模并行拆分的搜索问题。
950个Agent并不意味着950个独立科学家,而更接近950个并行运行的研究任务实例。
每个Agent可以围绕一个候选展开分析,然后把结果汇总到更高层的筛选流程里。
这类架构把AI科研从“让一个模型回答一个科学问题”,变成:
模型的价值不只体现在单次回答质量,而在于能不能把一个原本无法逐项处理的大搜索空间压缩到实验室可以承受的规模。
052.1亿Token换来的是搜索覆盖率
这次搜索用了约2.1亿Token。
单看数字很大,但科研Agent真正应该计算的不是“总共烧了多少Token”,而是:
Cost per experimentally useful hypothesis
如果950个Agent跑完以后,只生成几千份泛泛报告,没有真正形成可验证的候选,那2.1亿Token没有意义。
这次ART至少提供了一个比较完整的链条:
因此后续更值得追踪的指标包括:
-
每万个候选最终留下多少高质量假设; -
人类复核一个候选需要多久; -
AI筛选后实验命中率提高多少; -
有多少候选属于已有文献已知系统; -
Agent产生的错误候选比例; -
单个可实验假设的总计算成本。
这些数据才能判断Agent科学发现是否真的比传统筛选流程更高效。
06实验验证仍然是这条链路里最硬的一步
生物学发现和代码任务最大的区别,是很多结论不能仅靠模型或数据库确认。
模型可以发现一个异常结构,也可以提出它可能是什么,但最终仍要问:这个系统在真实生物环境里到底有没有功能?
ART目前最重要的结果,就是实验确认repeat array能够产生短RNA。
接下来仍然需要大量湿实验回答:
-
删除ART后噬菌体会发生什么; -
引入ART是否改变感染能力; -
RT突变后短RNA是否还会产生; -
repeat序列是否决定特定靶标; -
伴随蛋白是否参与识别或加工; -
ART在不同噬菌体中的功能是否一致。
只有这些问题逐渐被回答,ART才可能从“新系统”进入“新机制”。
如果未来能够证明它具有可编程核酸识别、编辑或者其他工程能力,才有资格进一步讨论它是不是一种新的生物技术平台。
现在就把它称为“新CRISPR”,证据还远远不够。
07这项工作和CRISPR相似的地方
CRISPR最初也不是以“基因编辑工具”的身份被发现的。
早期研究人员先注意到细菌基因组里异常的重复序列,随后用了很多年才逐渐理解它们与病毒防御之间的关系,并最终发展出基因编辑技术。
ART现在同样是从一个异常重复结构开始。
但历史路径相似,不代表结果一定相同。
ART可能最后成为一种新的分子工具,也可能只是噬菌体里一种非常有趣但应用范围有限的机制。
因此当前更适合关注的是:
-
ART repeat如何产生RNA; -
RT和短RNA之间是什么关系; -
是否存在特定识别对象; -
是否可以跨物种工作; -
是否具有可编程性。
这些才决定它未来有没有工程价值。
08科研Agent的角色变成“生成实验候选”
过去大模型在科研场景里的常见使用方式包括:
-
搜论文; -
总结论文; -
写代码; -
分析数据; -
帮忙润色论文。
ART这项工作多走了一步。
AI输出的不再只是文本,而是:一个可以拿进实验室验证的研究候选。
这会改变评价科研模型的方式。
传统Benchmark可以测知识问答和科学推理,但科研Agent更应该测:
-
Novel Candidate Recall -
False Discovery Rate -
Literature Novelty -
Experimental Hit Rate -
Human Review Time -
Cost per Validated Hypothesis
模型最后写得像不像论文,并不是最重要的指标。
能不能把科学家从几十万个候选带到几十个值得做实验的对象,才是这种系统的价值。
09这项发现目前仍然有明确边界
Anthropic此次公布的是一项预印本研究,目前尚未完成同行评议。
因此现阶段可以确认的范围包括:
-
Claude Agent参与了大规模RT搜索; -
约950个Agent在21小时内完成这轮工作; -
共使用约2.1亿Token; -
汇集超过20万个RT; -
筛出约3500个新候选系统; -
进一步收敛到20个重点候选; -
发现与RT相关的重复序列系统ART; -
实验确认ART repeat array能够表达成短RNA。
目前不能确认的包括:
-
ART的主要生物学功能; -
是否能够进行DNA切割; -
是否具有基因编辑能力; -
是否可以像CRISPR一样被编程; -
是否能够进入医疗或工业应用。
相关研究仍需经过同行评议和更多实验验证。
Feng Zhang在阅读预印本后认为该系统值得继续研究,这可以说明发现具有研究价值,但并不能替代正式同行评审或功能验证。
10AI科研还要看“候选到实验”的转化率
ART说明Claude已经可以在一个非常具体的科研流程里承担大规模候选搜索。
但一次成功案例还不足以证明这种模式可以稳定复制到其他科学问题。
下一步更应该看:相同Agent工作流连续运行10次、100次以后,能产生多少真正通过实验验证的新发现。
如果Agent每次都能:
那它会变成科研基础设施的一部分。
如果大量Agent最终只是制造更多需要专家检查的候选,瓶颈就会从“搜索不够快”转移到“人类复核不过来”。
所以这项工作的技术价值并不是Claude已经能够替科学家发现一切。
它证明的是另一件更具体的事情:当一个科学问题可以被拆成大量并行搜索、文献核查和模式识别任务时,Agent已经有能力把搜索空间压缩到实验室可以继续工作的范围。
ART最后能不能成为新的生物技术平台,还要等实验。
但从科研工作流来看,AI已经开始从论文阅读器,变成真正参与“提出下一步实验对象”的工具。
11参考来源
-
Anthropic:Claude discovers a novel enzyme system with CRISPR-like repeats
https://www.anthropic.com/news/claude-discovers-novel-enzyme-system -
Anthropic技术报告预印本:Formal report on ART discovery
https://www-cdn.anthropic.com/22573675ada52a8ca8a97a1a4b4326b2f208a071.pdf

