首页
模型资源
新药研发
资源中心
科研工具
关于我们
商城
集团站群
CN

Nature methods
单细胞基础模型预训练数据规模与多样性对模型性能的影响

2026-07-30
加入邮件订阅!
您将获得赛业生物最新资讯
摘要速览
Nature methods | 单细胞基础模型预训练数据规模与多样性对模型性能的影响

小赛推荐:

该研究系统评估了预训练数据规模和多样性对单细胞基础模型性能的影响,为单细胞转录组学中模型训练策略的优化提供了关键实证依据,提示研究者应更关注数据质量与任务对齐而非盲目扩大数据量。

 

文献概述

本文《Evaluating the role of pre-training dataset size and diversity on single-cell foundation model performance》,发表于《Nature methods》杂志,系统探讨了在单细胞转录组数据上预训练的深度学习模型中,数据规模和多样性对下游任务性能的影响。作者通过构建包含2220万个细胞的大规模scTab数据集,系统性地训练了400个模型并执行了6400次实验,覆盖多种模型架构与下游任务。研究结果挑战了当前“更大数据即更好性能”的普遍假设,揭示了单细胞基础模型在极小数据子集(如1%)即可达到性能饱和的现象。

背景知识

单细胞测序技术的快速发展催生了海量转录组数据,推动了scRNA-seq分析中基础模型(如scBERT、Geneformer)的应用。然而,与自然语言处理中明确的“数据缩放定律”不同,单细胞基础模型(scFMs)的性能是否随数据量增长而持续提升尚不明确。当前在细胞类型注释、批次效应校正和扰动响应预测等任务中,许多模型表现不及简单基线方法,提示可能存在训练或架构瓶颈。一个核心痛点在于,预训练通常依赖大规模计算资源,但若性能在小数据上即饱和,则大规模预训练可能浪费资源。此外,现有模型多采用“细胞作为句子”的tokenization策略,其生物学合理性受到质疑。本研究的切入点在于系统评估预训练数据规模与数据多样性对模型性能的影响,探索是否存在学习饱和点,并检验增加扰动数据是否能提升表征能力。

 

针对单细胞研究中的基因功能验证与疾病机制探索,赛业生物提供基于CRISPR技术的基因敲除小鼠模型定制服务,涵盖全身敲除与条件性敲除,适用于肿瘤、神经退行性疾病、代谢疾病等多种研究方向。通过Cre-LoxP系统实现组织特异性基因编辑,避免胚胎致死,助力深入解析基因在特定生理或病理环境下的功能。了解更多关于基因敲除小鼠模型的应用与定制流程。

 

研究方法与核心实验

作者使用scTab数据集(2220万细胞)作为基础,通过三种采样策略构建不同规模(1%–75%)和多样性(随机、细胞类型重加权、几何sketching)的预训练数据。五种模型架构——包括PCA、scVI、SSL、Geneformer和SCimilarity——在每种数据子集上预训练,共计400个模型。下游任务涵盖零样本和微调场景下的细胞类型分类、批次整合和扰动响应预测。为评估学习饱和点,作者定义“性能增益趋于平缓”的阈值,并计算达到该阈值所需的最小数据比例。此外,通过“spike-in”实验将10%或50%的Perturb-seq扰动数据加入预训练集,检验其对性能的影响。

关键结论与观点

  • 在所有模型和任务中,性能在预训练数据达到总集的1%–10%时即趋于饱和,表明单细胞基础模型存在显著的学习饱和现象,后续增加数据量不再提升性能。
  • 增加数据多样性(如通过细胞类型重加权或几何sketching)并未带来一致性能增益,提示当前的多样性策略未能有效提升模型泛化能力,需更精细的数据采样策略。
  • 将系统性扰动数据“spike-in”到预训练集中,并未改善细胞类型分类或批次整合性能,说明预训练任务与下游任务的对齐比数据多样性更重要。
  • 更大规模的模型(如扩大scVI或Geneformer参数量)在零样本分类中表现更好,但仍不从更大预训练数据中受益,表明模型容量与数据规模的平衡需重新思考。
  • SCimilarity在多个任务中表现最佳,因其对比学习目标直接对齐细胞类型识别任务,强调了预训练任务设计对下游性能的关键作用。

研究意义与展望

该研究对单细胞转录组学的计算分析范式提出了重要反思:盲目追求更大数据集可能无法提升模型性能,反而应优先优化数据质量、任务对齐和模型架构。对于药物开发,这意味着在构建疾病模型时,应更注重代表性细胞状态的覆盖而非总量。在疾病建模中,研究者可优先使用小规模高质量数据进行快速原型验证,避免不必要的计算开销。未来工作应探索更生物学合理的tokenization方法,如结合基因调控网络或通路信息,而非简单将基因表达视为“词汇”。

 

为支持单细胞研究中对特定基因突变的建模需求,赛业生物提供精准的点突变细胞系服务,基于高效的基因编辑平台实现无痕修复,支持A549、HEK293等多种细胞系。适用于疾病机制研究、药物耐药性分析及蛋白质功能研究,提供从载体构建到单克隆鉴定的全流程服务,助力高精度体外功能验证。

 

结语

本研究通过大规模实证分析揭示了单细胞基础模型性能的“学习饱和”现象,挑战了数据驱动模型必须依赖海量数据的传统观念。结果显示,无论是增加数据规模还是多样性,均未能持续提升模型在细胞类型注释、批次整合等关键任务上的表现,而模型性能更依赖于架构设计与预训练任务的生物学合理性。这一发现对单细胞转录组学研究具有基石意义:它引导研究者从“数据规模竞赛”转向“数据智能利用”,强调高质量、任务对齐的训练策略。对于疾病机制研究和精准医学,这意味着更高效、低成本的模型开发路径成为可能。未来,结合基因调控网络、细胞状态轨迹等先验知识的预训练任务设计,或将推动单细胞AI真正实现生物学可解释性与预测能力的双重突破。

 

文献来源:
Alan DenAdel, Madeline Hughes, Akshaya Thoutam, Ava P Amini, and Lorin Crawford. Evaluating the role of pre-training dataset size and diversity on single-cell foundation model performance. Nature methods.