在生殖医学领域,辅助生殖技术(Assisted Reproductive Technology, ART)的成功实施离不开准确的胚胎质量评估。当前临床主要依据胚胎形态学特征进行筛选,这一方法直观且易于实施,但难以充分反映胚胎的遗传与表观遗传状态,也可能受到操作者主观差异的影响。传统胚胎着床前遗传学检测(Preimplantation Genetic Testing, PGT)能够提供染色体状态与遗传信息,却需要进行滋养层细胞活检,存在操作复杂、成本较高及潜在胚胎损伤等局限。因此,利用废弃胚胎培养液(Spent Embryo Culture Medium, SECM)中的游离DNA(cell-free DNA, cfDNA)开展无创胚胎着床前遗传学检测(non-invasive PGT, niPGT),被认为是兼顾胚胎安全与分子信息获取的重要方向。
然而,SECM中的cfDNA来源复杂,除滋养外胚层(TE)和内细胞团(ICM)释放的胚胎DNA外,还可能包含来自颗粒细胞和极体的母源DNA。母源污染不仅会干扰胚胎真实分子特征,还可能造成性别不一致和假阴性结果,成为niPGT及无创胚胎质量评估走向临床应用的关键障碍。与此同时,如何从极少量cfDNA中同时提取甲基化、序列信息、片段组学等多维信号,并将其转化为可解释的胚胎质量指标,仍缺少系统解决方案。
近日,北京大学第三医院陈依东团队联合北京大学国际机器学习研究中心周沛劼团队在Advanced Science发表了题为NICE: A Two-Step Non-Invasive Framework for Embryo cfDNA Read Enrichment and Quality Assessment的研究论文。该研究提出两步式无创胚胎评估框架NICE:首先利用DECENT-plus在读段层面去除来自颗粒细胞和极体的母源干扰、富集胚胎来源cfDNA;随后整合甲基化与片段组学等多维特征,建立机器学习模型评估胚胎形态学质量。该框架将团队前期的母源污染去除研究进一步拓展到无创胚胎质量评价,为形态学筛选提供了新的分子层面补充信息(图1)。
![]()
图1|NICE框架流程图:(A) Decent-plus 进行胚胎来源cfDNA富集; (B) 胚胎源 cfDNA 上进行多维特征提取; (C-D) 使用多维生物特征利用机器学习建模进行胚胎质量评估及临床应用。
1. 构建DECENT-plus模型富集胚胎来源cfDNA
团队前期开发的DECENT算法可通过深度学习区分培养液中的母源与胚胎来源读段,并用于胚胎拷贝数变异重建。但原算法主要针对颗粒细胞污染,尚未显式处理另一类重要母源来源——极体。为进一步降低母源干扰,本研究构建DECENT-plus,将母源训练数据扩展为颗粒细胞和极体,将胚胎来源扩展为TE和ICM,并将每条读段的输入长度由66 bp延长至132 bp。模型共使用约3000万条来自四类细胞的测序读段进行训练与测试,输出每条cfDNA读段来源于母源细胞的概率。
由于后续胚胎质量分析更重视保留读段的纯度而非数量,研究采用严格阈值筛选高置信度胚胎读段。当母源概率阈值设为0.2时,保留读段中约80%被预测为胚胎来源,模型对高置信度读段的分类AUC达到0.84。DECENT-plus估计的样本母源污染水平与既往基于甲基化标志推断的参考比例呈高度相关(Pearson r=0.91,R²=0.82),表明该模型能够较稳健地解析SECM中cfDNA的细胞来源。(图2)
![]()
图 2|Decent-plus 进行胚胎源 cfDNA 读段富集,左图,在不同筛选阈值下保留读段分类 AUC 表现。右图,通过 Decent-plus 估计的样本母源污染比例与甲基化特征估计的样本母源污染比例的相关关系。
2. 提取多维cfDNA特征刻画胚胎质量
完成胚胎来源读段富集后,研究从154个具有足够胚胎读段的SECM样本中提取六类生物学特征:靶向区域甲基化(TM)、全基因组甲基化(GWM)、末端基序(EM)、片段长度(FLEN)、拷贝数变异(CNV)以及全基因组读段分布(TRN)。这些特征分别从表观遗传状态、核酸断裂模式和基因组结构等角度刻画胚胎来源cfDNA。
研究首先观察到,SECM整体甲基化水平会随母源污染比例升高而增加。经过污染校正后,不同形态学质量胚胎之间的甲基化水平呈现显著差异。进一步分析发现,若干与胚胎发育相关的基因组区域、141 bp片段频率、多个4-mer末端基序以及全基因组甲基化分布均在高质量与中低质量胚胎之间存在差异;CNV主成分分析则显示,高质量胚胎样本聚集更紧密,而中低质量胚胎具有更大的异质性。
3. 集成机器学习模型提升胚胎质量分类性能
针对每一类cfDNA特征,研究分别训练随机森林、逻辑回归、多层感知机、支持向量分类器和XGBoost模型,并通过交叉验证与超参数优化选择表现最优的模型。六类单一特征均表现出一定分类能力,其中TM、EM和FLEN特征表现最为突出。研究进一步对这三类特征的最优模型进行集成,最终获得AUC为0.812的胚胎质量分类性能,明显高于仅使用SECM整体甲基化率的传统基线(AUROC=0.551)。(图3)
为了验证两步式设计的必要性,研究还开展了敏感性分析:跳过DECENT-plus富集步骤、直接从低污染SECM样本的原始cfDNA中提取特征时,模型整体表现低于完整NICE流程。这一结果说明,先去除母源噪声、再提取胚胎特异性信号,是获得稳健分类结果的重要前提。
![]()
图 3|从胚胎源cfDNA 读段提取的不同类型遗传信息特征的机器学习模型交叉验证表现。 Ensemble 模型集成了表现最佳的三类特征 TM, EM, FLEN 获得最佳表现达到 AUC=0.812
4. 可解释性分析揭示与胚胎发育相关的分子特征
为了理解模型判断的生物学依据,研究对TM、EM和FLEN模型进行了特征重要性与SHAP分析。结果显示,校正母源污染后的样本整体甲基化水平是TM模型中最重要的预测特征;TE H3K9me3峰区域的平均甲基化水平位居其后。末端基序模型中,TGTC频率对分类贡献最大;片段长度模型则将138 bp片段频率识别为最重要的长度特征。
对TE H3K9me3峰相关基因的功能注释显示,其中约18%的基因可定位于启动子区域,并主要富集于细胞黏附和葡萄糖醛酸化等生物学过程。细胞黏附参与早期胚胎压实和紧密连接形成;葡萄糖醛酸代谢则与透明质酸等细胞外基质成分的合成有关。这些结果表明,NICE捕捉到的cfDNA特征并非单纯的统计信号,而可能反映胚胎发育能力相关的分子过程。
5. 关键特征分数与胚胎临床结局相关
本研究共纳入154枚胚胎,其中40枚胚胎接受移植;随访观察到9例活产。临床数据与形态学评估结果总体一致,高质量组的临床妊娠率显著高于中低质量组,而两组总体整倍体率没有显著差异。
进一步分析显示,四类关键机器学习特征分数均与临床妊娠率呈正相关,其中TM分数和集成分数的相关性尤为突出。从不同胚胎结局的分数分布来看,特征分数越高,获得临床妊娠和活产的可能性总体越高(图4)。这提示在形态学评分相同或相近的情况下,NICE有望提供额外信息,辅助临床进一步确定胚胎移植优先级。
![]()
图 4|NICE特征分数与整倍体率、临床妊娠及活产结局的关联。(A)不同形态学质量组胚胎的整倍体率比较。(B)不同形态学质量组胚胎的临床妊娠率比较。(C)4种机器学习特征评分与整倍体率及临床妊娠率的相关性。圆点大小表示Spearman相关系数的绝对值。(D)纳入研究的胚胎及其临床结局概览。纵轴表示不同生物特征构建的机器学习模型给出的胚胎评分,虚线表示相应特征依据ROC曲线确定的分类阈值;总体来看,评分越高,胚胎获得临床妊娠和活产的可能性越大。注:* P < 0.05;** P < 0.01;*** P < 0.001。
综上所述,本研究提出的NICE框架通过“DECENT-plus富集胚胎来源cfDNA”和“多维特征机器学习评估”两个连续步骤,降低了母源DNA对培养液分子信号的干扰,并建立了具有可解释性的无创胚胎质量评估方案。该研究将niPGT的关注点从胚胎染色体状态进一步拓展至胚胎质量与发育潜能评估,为形态学筛选提供了新的分子信息来源,在无创胚胎优选和辅助生殖临床决策中具有潜在应用价值。
需要指出的是,当前研究样本量及具有完整临床结局的移植样本仍相对有限,模型性能主要通过交叉验证获得。未来仍需在不同实验室、不同临床中心和更大规模独立队列中开展外部验证,并进一步评估NICE对胚胎着床、临床妊娠和活产结局的预测价值。
北京大学前沿交叉学科研究院博士生周雪娅与北京大学第三医院博士生丁澍为该研究论文的共同第一作者。北京大学第三医院乔杰院士,陈依东副研究员与北京大学国际机器学习研究中心周沛劼研究员为论文共同通讯作者。张振毅、上官巧玲等参与了研究。感谢北京大学高性能计算平台和生命科学中心计算平台的助力。
课题组招聘
北京大学第三医院乔杰院士/陈依东副研究员课题组联合招聘博士后(https://www.puh3.net.cn/info/4961/142771.htm)
合作导师介绍
乔杰教授,中国工程院院士,国家自然科学基金委医学科学部主任,北京大学医学部主任,国家妇产疾病临床医学研究中心主任,科技部“生殖与发育重大专项”首席科学家、教育部“长江学者”特聘教授、国家自然科学基金创新研究群体“生殖细胞发育”首席专家。乔杰院士多年来一直从事妇产及生殖健康相关临床与基础研究工作,带领团队从遗传学、表观遗传学角度对人类早期胚胎发育调控机制进行深入研究,探讨了常见生殖障碍疾病的病因、发病机制及诊疗策略,创新生育力保存综合体系并开发新的胚胎遗传诊断技术,为改善女性生育力、防治遗传性出生缺陷做出了重要的贡献。以通讯/第一作者在Lancet、JAMA、Science、Cell、Nature等国际知名学术期刊上发表SCI论文200余篇,主编我国首部生殖医学专业高等教育国家级规划教材《生殖工程学》《妇产科学》《生殖内分泌疾病诊断与治疗》等专著19部,授权40余项国家发明专利,获得国家科技进步二等奖3项、省部级一等奖3项及何梁何利科学与技术进步奖等。
陈依东,北京大学第三医院生殖中心副研究员。主要研究方向为生殖医学和遗传诊断。主持、参与国家重点研发计划、国家自然科学基金项目、北京市自然科学基金项目等科研项目9项。以第一/通讯作者在Cell Stem Cell、The Journal of Clinical Investigation、Science Advances、Advanced Science、Briefings in Bioinformatics、Cell Reports、eBioMedicine等发表SCI论文10余篇;申请、授权专利6项,获生物物理学会优秀成果奖,首届张丽珠生殖医学青年创新奖,入选中国科协第九届青年人才托举工程。
课题组长期招聘博士后,欢迎拥有实验或计算背景、且对生殖医学前沿方向有热情的青年才俊加盟。联系邮箱chenyidongahu@163.com,邮件主题请注明“博士后申请+姓名”。
论文链接:
https://advanced.onlinelibrary.wiley.com/doi/10.1002/advs.77327
代码与模型:
https://github.com/XueyaZhou-124/NICE
01
02
03
04
05
快点亮"在看”吧!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.