最近的大模型,有一种很明显的变化。
大家已经不满足只让它写文章、编程、做图片了。新的方向是让它走进实验室,参与真正的科学研究。
这时,大模型要面对的就是专业推理、量化预测和实验验证等复杂问题。
生命科学因此成为检验模型专业能力的重要场景,也正成为大模型竞争的新战场。
谷歌DeepMind和Isomorphic Labs把AlphaFold一路推进到AlphaFold 3,模型处理的对象已经从蛋白质结构扩展到DNA、RNA、配体等多类生命分子及其相互作用。
OpenAI则在今年4月16日推出面向生命科学研究的GPT-Rosalind,并在6月17日推出LifeSciBench,用来评估模型能不能处理真实研究工作,而不是只回答几道生物学知识题。
这些科技巨头的布局表明,生命科学模型的竞争不只是停留在知识覆盖和参数规模上,已经开始进入专业训练、任务评测和研发流程适配阶段。
一个更具产业意义的问题也随之出现:如何把生命科学领域的数据、任务和评测标准沉淀为可复用的训练体系,并将训练后的模型稳定部署到药物研发场景中?
就在几天前的2026年世界人工智能大会(WAIC 2026)上,英矽智能(Insilico Medicine,03696.HK)与腾讯健康宣布达成战略合作,尝试共同解决这一问题。
这次合作并非是让腾讯模型简单接入一套AI制药工具。
英矽智能将通过自研的MMAI Gym框架,利用生命科学领域的框架、数据、任务和基准评测体系,训练和强化腾讯模型。
腾讯则提供模型底座、高性能计算、云端部署和企业服务能力。
双方由此将专精模型的训练、评测与产业交付连接起来,探索一套可重复的具有实际转化意义的生命科学模型生产路径。
01
MMAI Gym,一所专门培养
药物研发AI的“训练营”
通用大模型进入生命科学领域,首先要补上的是一整套专业训练与评价体系。MMAI Gym所扮演的,正是“训练场”和“考场”的双重角色。

MMAI Gym是英矽智能面向生命科学推出的基础模型训练框架,由专业数据、任务设计、训练方法、实验验证和基准评测共同构成。
这套框架首先要解决的,是生命科学AI的“教材”问题。
传统大模型的训练数据主要来自论文、书籍、网页和数据库等公开内容。但药物研发中的很多关键知识并不以文本形式存在,而是分布在分子结构、蛋白口袋、化学反应、实验测量结果和研发决策之中。
公开论文通常更倾向于记录成功结果,可真实研发中大量失败实验、结构修改过程和项目取舍则很少公开。
MMAI Gym的差异之一,正是引入了大量来自真实研发与实验体系的数据。
如下图所示,MMAI Gym整合的数据资源包括超过10亿个(1B+)含3D构象、结合信息和实验结果的数据点,超过1亿条(100M+)化学反应与超过1万亿Token( 1T+ tokens)的工业有机合成描述,超过500万个(5M+)DMPK、毒性及脱靶相关数据点,以及超过400万份(4M+)蛋白质—配体复合物轨迹快照。
图注:MMAI Gym:集成数据、训练与基准测试套件
在AI for Science中,这类一手实验数据尤其重要。
模型从公开论文中学到的,主要是人类已经整理和表达出来的知识。实验数据则让模型直接面对真实世界的测量结果,理解哪些预测成立、哪些判断失效,以及错误可能出现在哪个环节。
这类实验数据形式也比自然语言更加复杂。
因此,MMAI Gym包含了200多项训练任务,覆盖二维分子、三维分子、二维蛋白质、三维蛋白质、药物—基因相互作用以及跨领域多模态等多个类别。
有了“教材”,下一步就是如何安排训练课程。
MMAI Gym结合多任务监督微调和强化微调,让模型学习药物化学优化、合成与反应推理、药物代谢与药代动力学、毒性预测、三维结构分析和部分生物学推理任务。
这套多任务训练体系的目标,是减少生命科学模型的“偏科”。
传统专用模型通常只解决一种问题,例如只做毒性预测、分子生成或逆合成规划。MMAI Gym则希望在同一个基础模型中形成性质预测、分子优化、合成规划、靶点分析、官能团推理和三维结构理解等多项能力,把模型训练成能够覆盖多个药物发现环节的“全科生”。
这里的“全科”并不是指模型已经能够独立完成整个新药研发流程,而是指它不再局限于单一预测任务,可以在统一模型中处理多种相互关联的药物研发问题。
训练完成后,模型还要进入“考场”。
MMAI Gym设置了自动化评测,包含公开基准、内部基准和分布外测试集。
这套评测体系,也与英矽智能自身的药物研发实践密切相关。
自2021年以来,英矽智能已提名31个临床前候选化合物,其中13个获得临床试验批准或许可。值得注意的是,全球首个由AI赋能发现靶点并设计分子的特发性肺纤维化候选药物Rentosertib,近期已启动Ⅲ期临床试验。
这些在靶点发现、分子设计、实验验证和临床开发过程中积累的一手数据与研发经验,为MMAI Gym设计专业任务、训练科学推理和建立内部评测体系提供了重要基础。
2026年3月,英矽智能与Liquid AI完成了首个基于MMAI Gym的合作,推出LFM2-2.6B-MMAI。该模型验证了科学领域基础模型应用的关键在于高效的架构设计,而非简单的规模扩张。
经过MMAI Gym训练后,原本在专业任务领域失败率高达 75%–95% 的 LLM,可在关键药物发现基准测试中实现最高 10 倍的性能提升。
如果把基础模型看作进入训练营的学员,那么LFM2-2.6B-MMAI就是MMAI Gym培养出的首位“结营学员”。
这个案例的真正价值,在于初步验证了MMAI Gym“训练营”的可行性,它有能力将专业数据、科学任务、训练方法和评测标准,组织成一套可重复的“教学体系”。
基础模型会更换,模型架构也会变化,但药物研发所需的数据体系、科学推理方法和评价标准是可以不断沉淀的。
因此,MMAI Gym的核心价值,不在于某一个学员的成绩单,而在于它持续培养“生命科学专科生”的能力。
此次与腾讯健康合作,则是要把腾讯模型送入这所“训练营”,进一步检验这套培养体系能否适配新的模型底座,并走向更大规模的产业应用。
02
不只是炼出一个模型,英矽智能和腾讯
在搭一条生命科学模型流水线
模型训练完成,只是专业能力交付的起点。
生命科学模型要进入企业,不能只有模型权重和一张Benchmark成绩表。
企业还要考虑训练数据如何治理,内部数据如何接入,权限怎样控制,推理服务能否稳定运行,输出是否能够追溯,模型更新后效果是提升还是退化,以及不同研发团队如何调用。
还有一个更现实的问题,谁来维护。
大型药企或许有自己的算法团队、数据平台和算力资源,但中小药企、初创公司和高校实验室未必具备同样的条件。
即便拿到一个开源模型,它们也可能卡在环境配置、数据清洗、模型适配、专业评测和持续运维上。
模型免费,不等于使用模型的成本很低。很多行业模型真正昂贵的部分,都发生在下载权重之后。
英矽智能与腾讯健康真正想串起来的,正是这些散落在模型之外的环节。
英矽智能提供生命科学领域的数据、任务体系、模型训练和专业评测能力;腾讯提供基础模型、高性能计算、云端基础设施、安全能力和企业服务体系。
模型完成训练之后,还可以通过腾讯云进行部署、服务封装和生态分发,再根据企业使用中的新任务与反馈继续迭代。
顺着上面的逻辑看,整个流程如果跑通,就不只是做出某个模型。
它更像是一条生命科学模型的生产与交付流水线。
通用模型从一端进入,经过专业数据训练、科学任务强化和研发基准评测,再从另一端以云服务、接口或者灵活部署的形式进入企业。
03
专业模型从少数企业能力,变成
产业基础设施
对于大型药企,英矽智能与腾讯健康这套模式提供的不是一个脱离现有研发体系的通用工具。
它们可以在安全合规的基础设施上,将内部实验数据、项目记录和研发流程接入专精模型。
在保留自身数据资产和工作流的基础上进行企业级适配,使模型进一步理解具体项目的研究语境。
中小药企和科研机构面对的则是另一类问题。
它们可能有很好的靶点想法,也有经验丰富的药物化学家,但没有足够预算自建算力集群,很难长期维持一支覆盖模型训练、评测、部署和运维的算法团队。
如果经过验证的模型能力能够通过云端接口或灵活部署方式获得,这些团队就可以把更多精力放在科学问题和实验验证上。
过去需要专业计算机辅助药物设计(CADD)科学家完成的部分任务,也有机会变成药物化学家、生物学家和临床研发人员可以直接调用的能力。
这套模式降低的并非单一的算力成本,还降低了三道长期存在的门槛。
训练生命科学模型的门槛、验证模型专业能力的门槛,以及把模型稳定部署到企业并持续维护的门槛。
当专业训练、科学评测和企业交付被封装为标准化服务,生命科学模型才可能从少数机构内部的专有能力,进一步转化为可被行业调用的基础设施。
04
AI for Science的竞争,
开始从参数转向专业训练体系
观察AI for Science的演进,很像回看计算机早期的发展历程。
最早使用计算机必须同时理解底层硬件、编写基础代码,只有极少数专家能真正驾驭。
后来,有了操作系统、数据库和云计算的出现,把这些通用能力封装成标准化的基础设施,才让成千上万的开发者得以在上面构建应用。
生命科学模型现在正处在类似的拐点上。
少数头部公司已经能训练专用模型,搭建评测体系,把模型接进自己的研发流水线。
但对行业里的大多数团队来说,这些能力仍然很重、很散,而且依赖少数专家。
英矽智能与腾讯健康尝试做的,就是把这些关键能力封装起来。
MMAI Gym负责让模型获得专业训练,腾讯的模型底座、算力与云生态负责让训练后的能力被部署和调用。基础模型负责提供通用能力,而真正决定药物研发水平的,是经过专业训练以后形成的领域模型。
看到这里,再回头看谷歌和OpenAI在生命科学上的动作,方向就更清楚了。
AI for Science的竞争,正在从模型知道多少科学知识,转向模型能不能完成真实科学任务。
而真正的生命科学智能,要在专业训练和真实验证中一点点长出来。
参考资料:
https://blog.google/innovation-and-ai/products/google-deepmind-isomorphic-alphafold-3-ai-model/;
https://openai.com/zh-Hans-CN/index/introducing-gpt-rosalind/;
https://cdn.openai.com/pdf/b4299379-0a97-4ffa-8b9b-c3fbb299caa9/lifescibench_preprint.pdf;
https://insilico.com/news_sc/hb5gyoa9r1-ai;
https://arxiv.org/pdf/2603.03517;
https://insilico.com/mmai;
https://insilico.com/news_sc/xjk94yelj1-mmai-gymliquid-ai
END
关注+星标,获取AI前沿进展与优质开源项目

