
Nature Genetics
MIXPRS实现基于汇总统计的多群体多方法多基因风险评分整合
小赛推荐:
该研究为复杂疾病遗传风险预测提供了无需个体水平数据的稳健框架,显著提升了非欧洲人群的PRS性能,对精准医学研究中的跨群体可推广性设计具有直接指导意义。
文献概述
本文《MIXPRS enables multi-population and multi-method polygenic risk scores using summary statistics》,发表于《Nature Genetics》杂志,系统探讨了如何在缺乏个体水平数据的情况下,通过整合多种多群体PRS方法,提升非欧洲人群的遗传风险预测准确性。作者提出了MIXPRS框架,基于数据分裂范式,仅依赖GWAS汇总统计即可实现稳健的PRS集成。该方法通过单核苷酸多态性(SNP)修剪缓解连锁不平衡(LD)不匹配问题,并采用非负最小二乘回归(NNLS)估计组合权重。研究进一步扩展至MIXPRS+,整合功能注释和临床PRS,显著提升在非欧洲群体中的表现。背景知识
目前,大多数遗传研究仍以欧洲人群为主,导致PRS在非欧洲群体中的预测性能显著下降,加剧了基因组医学的健康不平等。尽管已开发多种多群体PRS方法,但无一在所有群体和性状中表现最优,且多数需要个体水平的调参数据,这在代表性不足群体中常不可得。此外,GWAS荟萃分析产生的单一汇总统计限制了独立训练与调参数据的获取,增加过拟合风险。现有方法如JointPRS、PRS-CSx等虽整合多群体信息,但对LD参考面板的依赖易引发LD不匹配问题。MIXPRS的切入点在于:利用数据分裂(data fission)从单一GWAS汇总统计中生成独立训练与调参数据,并引入SNP修剪与NNLS回归提升鲁棒性,从而在不依赖个体数据的前提下实现多方法、多群体PRS的最优集成。
研究方法与核心实验
作者在模拟和真实数据中评估MIXPRS性能,使用UK Biobank(UKBB)和All of Us(AoU)数据集,涵盖26个性状和四个非欧洲群体(EAS、AFR、SAS、AMR)。模拟研究基于UKBB的欧洲GWAS汇总统计和1000 Genomes单倍型生成的非欧洲数据,比较MIXPRS与JointPRS、XPASS、SDPRX、PRS-CSx、MUSSEL、PROSPER和BridgePRS等方法。MIXPRS采用三步流程:首先,通过数据分裂从目标群体GWAS中生成独立的训练和调参数据集,使用LD修剪(r² < 0.5)和单位协方差结构缓解LD不匹配;其次,使用JointPRS-auto和SDPRX计算PRS效应值,并通过NNLS回归估计组合权重;最后,使用完整GWAS数据重新计算PRS并加权整合为最终MIXPRS。
在真实数据中,作者在无调参数据条件下比较MIXPRS与现有方法,结果显示MIXPRS在所有群体中均优于基准方法,尤其在SAS和AMR群体中提升显著(分别达33.33%和43.52%)。进一步与需个体数据的IndPRS比较,MIXPRS性能接近,表明其有效捕捉了多方法集成的增益。扩展版本MIXPRS+整合了ClinicalPRS和SBayesRC,在BMI和CAD等性状中进一步提升预测性能、风险分层和校准能力。关键结论与观点
研究意义与展望
MIXPRS为PRS研究提供了无需个体水平数据的通用集成框架,极大提升了非欧洲群体的遗传风险预测能力,推动了精准医学的公平性。其基于汇总统计的设计降低了数据共享壁垒,便于在隐私敏感环境中应用。
该框架的灵活性允许未来整合更多PRS方法、功能注释和跨性状信息,有望成为多群体PRS分析的标准工具。此外,MIXPRS+展示了如何将大型荟萃分析产生的临床PRS与多群体方法结合,为药物开发中的风险分层和临床试验设计提供了更准确的遗传工具。
结语
该研究提出的MIXPRS框架通过创新性地结合数据分裂、SNP修剪和NNLS回归,解决了多群体PRS集成中依赖个体数据和LD不匹配的关键瓶颈。其在非欧洲群体中的一致优越性能,标志着向公平、可推广的基因组医学迈出了重要一步。MIXPRS不仅提升了复杂疾病如CAD和BMI的遗传风险预测,还为后续研究提供了无需个体数据的标准化集成方案。未来,随着更多非欧洲GWAS数据的积累,MIXPRS有望成为跨群体PRS分析的基石工具,助力在真实世界中实现精准预防和个性化治疗,特别是在当前全球健康不平等背景下,其对相关疾病照护体系的变革潜力不可估量。




