首页
模型资源
新药研发
资源中心
科研工具
关于我们
商城
集团站群
CN

Nature Methods
ClairS:基于深度学习的长读长肿瘤–正常配对体细胞小变异检测方法

2026-08-13
加入邮件订阅!
您将获得赛业生物最新资讯
摘要速览
Nature Methods | ClairS:基于深度学习的长读长肿瘤–正常配对体细胞小变异检测方法

小赛推荐:

该研究为肿瘤基因组学提供了适用于纳米孔测序数据的高精度体细胞变异检测工具,显著提升了低等位基因频率变异的检出能力,对低纯度肿瘤样本的分析具有重要指导意义。

 

文献概述

本文《ClairS: a deep-learning method for long-read tumor–normal pair somatic small variant calling》,发表于《Nature Methods》杂志,系统探讨了如何利用深度学习框架解决长读长测序在体细胞小变异(SNV和indel)检测中的挑战。作者提出了一种名为Clair-Somatic(ClairS)的新方法,专门针对Oxford Nanopore Technologies(ONT)平台的高噪声长读数据进行优化。该方法通过创新的合成数据训练策略和分相信息整合,实现了在低肿瘤纯度和低等位基因频率条件下的高灵敏度与精确度。研究进一步通过多平台、多癌种细胞系验证其泛化能力,为临床级体细胞变异检测提供了可靠解决方案。

背景知识

当前,肿瘤异质性和克隆进化导致体细胞变异等位基因频率(VAF)常低于10%,使得低VAF变异检测成为癌症基因组学的核心痛点。尽管短读长测序已广泛用于体细胞突变检测,但受限于读长,难以跨越重复区域或实现单倍型分相,导致在同源区域或结构变异邻近区域的变异检测不准确。近年来,长读长测序技术如ONT和PacBio为解决这些问题提供了可能,但其较高的原始错误率(尤其在早期化学体系中)导致传统基于短读的变异检测工具如Strelka、Mutect2无法直接应用。此外,缺乏足够规模的已知真实体细胞变异训练集限制了深度学习方法的发展。现有工具如DeepSomatic依赖真实肿瘤样本,受限于癌种覆盖和多平台验证成本。因此,亟需一种不依赖大量真实肿瘤数据、可泛化至不同测序平台和肿瘤类型的体细胞变异检测方法。ClairS通过模拟体细胞变异的合成策略,绕过真实训练数据的限制,同时充分利用长读长的分相优势,精准识别低VAF变异,解决了上述瓶颈。

 

针对肿瘤基因组研究,赛业生物提供全人源化抗体小鼠模型HUGO-Ab®,可用于开发高亲和力、低免疫原性的治疗性抗体,支持肿瘤免疫治疗药物的研发与筛选,适用于多种癌症类型包括乳腺癌和肺癌。

 

研究方法与核心实验

作者采用了一种创新的合成数据训练策略,利用GIAB项目中两个个体(HG001和HG002)的ONT长读数据,将一个个体的种系变异视为另一个个体的“体细胞”变异,从而构建大规模、多样化的训练集。该方法可灵活控制肿瘤纯度、测序深度和正常样本污染水平,覆盖真实肿瘤中常见的复杂场景。训练后的模型在HCC1395/HCC1395BL细胞系对上进行基准测试,该数据集由SEQC2联盟提供高置信度真实变异集。ClairS整合了Clair3的种系变异检测能力,并结合LongPhase或WhatsHap进行单倍型分相,利用肿瘤样本中杂合SNP对读段进行单倍型标记。在变异检测阶段,ClairS并行使用pileup和全比对两种神经网络,分别捕捉局部信号和全局比对特征,最终融合输出。为减少假阳性,引入第三步——祖先单倍型支持筛选,即通过远端种系变异验证候选体细胞变异是否位于一致的单倍型上。

关键结论与观点

  • 在50×肿瘤/25×正常覆盖度下,ClairS对SNV的F1分数达到89.83%,indel为73.38%;使用真实癌细胞系增强训练后,性能提升至96.19%和79.67% —— 表明合成数据训练结合真实样本微调是提升模型泛化能力的有效路径
  • 分相信息显著提升低VAF变异检测性能,尤其是在VAF < 0.1时,phasable变异的F1分数远高于unphasable变异 —— 强调了单倍型分相在体细胞变异检测中的关键作用
  • 在肿瘤纯度低至20%时,ClairS仍保持高召回率,优于现有方法 —— 证明其适用于低纯度肿瘤样本的临床检测
  • 模型在COLO829/BL和HCC1954/BL等多个独立数据集上表现优异,验证了其跨平台、跨癌种的稳定性 —— 支持其作为通用体细胞变异检测工具的潜力
  • 复杂基因组区域(如重复序列、低复杂度区)仍是变异检测难点,排除这些区域后indel F1提升16.58% —— 揭示了基因组复杂性对变异检测算法的持续挑战

研究意义与展望

ClairS的推出填补了长读长测序在体细胞小变异检测领域的工具空白,尤其适用于需要高灵敏度的液体活检或微小残留病(MRD)监测场景。其对低VAF变异的精准识别能力,有助于更早发现肿瘤克隆演化信号,提升肿瘤早筛和耐药监测的准确性。未来,结合甲基化信号或RNA长读数据,可进一步拓展其在表观遗传变异和融合基因检测中的应用。

从药物开发角度看,ClairS可用于更精确地定义肿瘤突变负荷(TMB)和微卫星不稳定性(MSI),辅助免疫治疗患者筛选。在疾病建模中,该工具可用于验证基因编辑细胞系或PDX模型中是否引入意外体细胞突变,提升模型可靠性。

 

为加速肿瘤药物研发,赛业生物提供基于基因编辑小鼠的肿瘤药效评价服务,涵盖原位成瘤、CDX/PDX模型构建及药效评估,支持多种给药方式和活体成像,助力抗肿瘤新药的临床前研究。

 

结语

ClairS代表了长读长测序在癌症基因组分析中的一次重要突破。通过巧妙的合成数据训练和深度神经网络架构设计,它克服了ONT数据高错误率和体细胞变异VAF连续性带来的挑战,实现了高精度、高灵敏度的SNV和indel检测。其在低肿瘤纯度和低VAF条件下的稳健性能,使其特别适用于早期癌症检测、MRD监测和异质性分析等临床关键场景。该工具的开源性质也促进了社区协作与方法迭代。未来,随着Q20+化学和Dorado碱基识别进一步降低测序错误,ClairS有望成为肿瘤基因组分析的标准流程之一,推动精准肿瘤学从研究走向临床常规应用。对于相关疾病如乳腺癌、肺癌等实体瘤的分子分型与动态监测,ClairS提供了更完整的变异图谱,有望成为临床决策支持系统的重要组成部分。

 

文献来源:
Zhenxian Zheng, Lei Chen, Junhao Su, Tak-Wah Lam, and Ruibang Luo. ClairS: a deep-learning method for long-read tumor–normal pair somatic small variant calling. Nature Methods.