将 ScienceAI设为星标
第一时间掌握
新鲜的 AI for Science 资讯
编辑丨&
生物医学领域正迎来大模型爆发的热潮,从蛋白质结构预测到基因组序列理解,基础模型的应用场景日益丰富。然而,高分榜单是否真实反映了模型的泛化能力?2026年9月4日,德国海森堡大学、美国纽约大学等团队在《Nature Methods》发表综述文章「Benchmarking biomedical foundation models」,深入探讨生物医学基础模型的评估困境。
文章指出,传统的“选任务、算指标、排榜单”模式已不足以评估具有广泛适应能力的基础模型。真正的核心价值在于构建能验证模型是否习得可泛化生物学知识的测试体系。
论文链接:https://www.nature.com/articles/s41592-026-03182-y
传统评估逻辑的局限
传统机器学习依赖训练集与测试集的划分,通过预测准确率衡量模型性能。生物医学领域已建立如CASP(蛋白质结构预测)、DREAM(基因调控)等数百个挑战赛和基准体系。
图 1:基础模型的独特特征。
然而,仅凭少数几个 benchmark 如同以点代面。模型可能在特定任务上表现优异,却缺乏跨任务、跨数据集及跨生物学场景的泛化能力。现有评估更多体现的是模型对特定场景的适配度,而非其潜在的综合能力。
单细胞基础模型的深度剖析
研究重点聚焦于单细胞基础模型(scFMs)。此类模型旨在从海量单细胞组学数据中学习通用表示,服务于跨物种比较、数据整合、缺失模态推断及扰动响应预测等任务。由于不同模型在训练数据、架构及预处理方式上存在差异,亟需更复杂的评估体系。
评估应覆盖不同技术平台、物种、器官、疾病环境及扰动条件,以消除单细胞技术的系统性偏差。
图 2:用标准任务对基础模型进行基准测试的局限性。
扰动预测具有独特价值。若模型能准确预测未见过的基因或药物扰动后的细胞变化,则表明其触及了基因调控机制,而非仅仅记忆细胞形态。
此外,调参与训练方案显著影响结果。研究发现,在预训练的 scGPT 上嵌套随机森林模型,其扰动探测效果有时优于直接微调 scGPT。因此,“模型越大、微调效果越好”并非绝对真理。
摒弃唯分数论
目前 scFM 广泛应用于批次校正、细胞注释、多组学对齐等任务,但单一指标的高分不代表整体性能优越,部分指标甚至缺乏可靠性。例如在扰动预测中,因缺乏统一且具生物学意义的稳健指标,不同研究常得出相反结论。
图 3:基准测试基础模型面临的特定挑战及对应的解决方案。
文章建议,benchmark 不应只提供一个数字,而应引入简单基线、null model 及反映不可约变异的 upper-bound reference,并通过消融实验解析模型性能来源。
随着数据类型扩展至由大语言模型驱动的智能体系统(agentic systems),评估维度需从单一准确率拓展至中间步骤得分、可信度、协作能力及规则遵循情况(alignment)。
构建动态评估生态
未来的模型测评不应局限于静态榜单,而应建立由多学科共同参与、持续更新的 Benchmark 生态。新启动的 BEACON(Benchmarking, Evaluation and assessment CONsortium)致力于连接各领域评测经验,建立标准化、可复现的评价框架。
科学模型的进阶不在于模仿训练数据,而在于通过严格全面的评估体系,明确其可泛化能力的边界。
人工智能 × [ 生物 神经科学 数学 物理 化学 材料 ]
「ScienceAI」关注人工智能与其他前沿技术及基础科学的交叉研究与融合发展。
欢迎关注标星,并点击右下角点赞和在看。

