11
十余年来,DNA甲基化研究范式经历了系统性升级。早期研究聚焦小样本病例与对照间的差异甲基化位点(DMP)或差异甲基化区域(DMR)。随着队列规模扩大、随访时间延长,以及多组学和医学影像数据不断积累,规模化甲基化研究更关注信号的人群可复现性、时序动态特征,以及甲基化数据表观遗传时钟、甲基化风险评分(MRS)或疾病分类模型的应用,这也重新定义了技术平台的价值。
对于数千至数万样本的规模化队列研究而言,位点覆盖仍然重要,但不同数据批次一致性、实验稳定性、实验周期可控性,以及数据复用能力,也是决定研究质量的重要指标。因此,规模化DNA甲基化研究真正需要的不只是单次高通量检测,更是一套能够持续产生标准化、可复用数据的研究体系。
1.规模化甲基化研究的“快”:标准实验体系与数据分析
传统EWAS研究范式已无法满足规模化DNA甲基化研究的全部需求。如今,越来越多甲基化研究正在建立一条更严谨的证据链:
位点发现 → 独立复现 → 纵向时序验证 → 模型构建 → 外部验证 → 跨队列应用
研究目标升级后,数据标准化成为表观遗传模型构建的前提。表观遗传时钟、MRS、Protein EpiScores以及疾病分类模型均依赖稳定统一的CpG位点检测体系,需要多批次、多人群数据可横向对比,且在后续队列中可复现。
1
湿实验:可预测的批次化稳定产出
在小样本探索性研究中,实验波动或操作偏差的影响有限。但在规模化甲基化研究中,人员操作、批次差异和设备排期等细微问题会被持续放大,最终影响实验数据质量。因此,规模化研究所需要的“快”,不只是某一个样本能多快完成,而是整个项目能否稳定、可控、可持续的交付合格数据。
以Infinium甲基化检测为例,官方工作流将DNA扩增、片段化、杂交、延伸染色和成像安排在固定的3天。搭配前置的DNA质控和亚硫酸氢盐转化标准流程,可实现核心实验步骤、批次容量和设备占用时间的相对固定,便于研究团队提前规划样本、人员和耗材,保障实验的批次化稳定产出[1] 。
实际操作中,这种可预测性还需通过合理的实验设计来实现。例如,避免病例与对照、不同中心样本以及不同随访时间点的样本与固定批次、孔位绑定,同时设置技术重复、参考样本和转化效率监测。标准化流程并不能完全消除批次效应,但能精准溯源误差,实现精细化质控,保障大规模数据的稳定性。
2
干实验:精简数据路径,搭建标准化分析体系
DNA甲基化芯片通常输出结构统一的IDAT文件,无需全基因组reads的比对、去重和逐位点甲基化calling,大幅缩短了原始数据到甲基化矩阵的数据处理路径,便于建立标准化SOP,适配大规模队列批量分析需求。
围绕Infinium数据,研究领域目前已形成了较成熟的分析软件生态:minfi用于原始信号读取、质量评估、预处理及DMP和DMR分析;ENmix矫正背景噪声、染料偏差和探针类型偏差;SeSAMe识别低信号、异常杂交和基因组缺失造成的伪甲基化信号[2–4] 。但工具链的成熟不代表可以“一键获得结论”,参数选择、探针过滤、细胞组成校正和模型设计仍需要专业判断。对于规模化研究而言,精简的标准化数据分析路径,可快速形成直接用于后续统计分析数据矩阵。
2.标准化的长期价值:构建可复用的数据资产
固定探针设计是规模化模型研究的重要优势,标准化CpG坐标实现了跨批次、跨队列数据比较,为数据复现验证、二次分析创造了条件。依托持续迭代的新算法、参考图谱或疾病分类模型,历史甲基化芯片数据无需重测,即可挖掘全新价值。例如,MethylationEPIC v2芯片[5]在拓展功能区域覆盖的同时,保留了表观遗传时钟、细胞解卷积、性状关联核心位点,还承接了由450K和EPIC v1积累的数据和分析生态,保持了较好的准确性和重复性。
2026年的一项泛癌研究充分展示了标准化数据积累如何转化为模型资产[6]。研究整理了10,756份覆盖54类正常组织和肿瘤组织的甲基化图谱,基于1208个CpG位点构建泛癌模型,并使用28项独立研究的2,306份数据进行外部验证。该训练和验证数据来自450K、EPIC v1和EPIC v2等不同版本芯片,证明了跨时间、跨机构、跨平台的标准化数据,可将零散的研究数据转化为可持续开发的科研资产。
类似的复用路径也出现在罕见病Episignature研究中。该研究以外周血DNA甲基化芯片数据建立疾病特异性参考图谱,为部分临床意义未明变异提供功能学证据[7]。这一结果建立在参考样本、分类算法和疾病知识库持续积累的基础之上,充分体现了标准化数据长效复用的核心优势。
3.多维数据复用:甲基化数据的多层科研价值
标准化甲基化数据具备极强的多维复用性,单份样本数据可通过不同算法,挖掘遗传调控、免疫表型、衰老进程、疾病风险等多维度信息,全面支撑规模化研究。
1
mQTL:区分遗传驱动与环境调控
DNA甲基化受遗传、环境、年龄和疾病的共同影响。GoDMC联盟基于32,851名参与者的基因型和血液DNA甲基化数据,鉴定出27万余个独立mQTL关联,可解释约15%-17%的DNA甲基化加性遗传方差[8] 。这意味着EWAS发现的疾病相关CpG位点不能直接归因于环境暴露或疾病过程。
因此,依托队列基因型与甲基化联合数据,mQTL分析可以进一步区分遗传驱动、环境响应和疾病特异性甲基化变化,解析疾病调控机制。
2
细胞解卷积:校正混合信号,挖掘新免疫表型
血液、脑和肿瘤等组织由多种细胞构成,其bulk样本甲基化信号为多细胞混合结果,细胞比例变化易造成假阳性差异。
基于细胞参考图谱,甲基化数据可估算样本中的细胞组成。Salas等将外周血DNA甲基化解卷积扩展至12类白细胞亚群,并进一步衍生出56项免疫评估指标,估算样本细胞组成[9]。该策略一方面可校正EWAS的细胞混杂偏差,提升研究精准度;另一方面可将免疫细胞比例作为独立表型,探索其与疾病、衰老、环境暴露或治疗的关联,尤其适合无流式检测数据历史队列的回顾性研究。
3
表观遗传时钟:提供早期分子反馈
不同表观遗传时钟代表不同的生物学目标,有些时钟拟合实足年龄,有些关联疾病风险。具有逻辑代表性的DunedinPACE模型依托跨20年队列随访数据,整合19项器官功能指标,量化了个体衰老速率,并转化为单时间点血液DNA甲基化评分[10],实现动态衰老评估。CALERIE干预试验证实,2年热量限制干预未改变个体的生物年龄,但DunedinPACE显示受试者衰老速度放缓[11]。以上结果表明,表观遗传时钟可为纵向研究和干预试验提供较早、可量化的阶段性分子证据。
4
MRS:将群体关联到个体连续评分
单个CpG位点的效应通常较小,稳定性差。MRS可整合多位点信号,构建个体连续风险评分。从方法学看,MRS代表了DNA甲基化研究从群体关联走向精准医学模型的一条重要路径:位点筛选、权重赋值、模型构建、临床对比与独立验证。
2025年发表的一项2型糖尿病研究显示,基于87个甲基化位点建立的MRS模型AUC为0.81,联合临床风险因素后达到0.84,显著优于单一临床风险因素(AUC0.69),且在独立队列中性能稳定[12]。该MRS将甲基化信息转化为与临床指标、PRS和长期结局直接比较的连续风险评分,有效弥补了传统临床模型与PRS的评估短板。
5
Protein EpiScores:打通甲基化与多组学关联
Protein EpiScores依托机器学习,通过挖掘DNA甲基化模式与蛋白质组的关联,构建蛋白表达预测评分。Gadd等利用配对蛋白质组与DNA甲基化数据,为953种循环蛋白训练EpiScores,筛选出109个较稳健的评分应用于具有长期健康记录的Generation Scotland队列,探索其与后续疾病结局的关系[13]。该体系的优势在于无需大规模蛋白组测序,仅依托标准化甲基化数据即可快速计算评分,大幅降低了多组学研究成本,拓展了表观遗传数据的科研应用场景。
4.数据复用边界:标准化不等于无条件迁移
标准化为数据复用提供了基础,但生物学差异和技术差异导致数据无法直接跨场景迁移。在迁移到新队列之前,需要回答以下四类问题:
![]()
SeSAMe研究表明,基因组缺失易导致探针杂交失败,产生虚假甲基化信号,表明即使样本质控合格,也需要强化探针级精细质控[4]。同样,跨平台数据复用也不能只看样本层面的整体相关性。EPIC v1与EPIC v2的比较研究发现,两代平台的芯片整体水平具有较高一致性,但单探针信号存在差异,部分细胞比例、表观时钟和其他甲基化指标存在系统性偏移,需通过平台校正或分版本建模减轻这种差异[14]。
因此,“模型位点在新平台上得到覆盖”只是迁移的第一步,其预测效能和阈值稳定性需要在目标人群和目标平台上重新验证。
5.技术协同:芯片与测序互补而非替代
随着全基因组甲基化测序、5-Base和长读长测序技术的发展,学界常探讨的是:DNA甲基化芯片是否会被测序取代?从研究设计角度看,这并不是一个简单的新旧技术替代问题,因为两类技术解决的是不同层级的科研需求。
![]()
DNA甲基化芯片适配规模化队列研究,其优势主要体现在标准化流程、大样本、跨队列比较和既有模型调用;全基因组甲基化测序更适合新位点发现、连续区域解析,以及基因组变异与甲基化的联合研究,但成本高、算力需求大、标准化难度高,难以适配大样本队列。
平台选择是基于研究问题本身。目前行业内主流研究路径为“测序发现、芯片验证”:全基因组甲基化测序发现新位点和新区域,拓展表观遗传信号边界;甲基化芯片依托标准化优势完成大样本验证与模型构建。反之,长期积累的芯片数据和分类模型,也可以为新型测序数据提供参考坐标、候选区域和验证队列,两者形成完整科研闭环。
结语
当前的DNA甲基化研究已全面进入规模化、标准化、可复用的发展阶段。规模化研究的核心竞争力,不再是单次检测的位点数量,而是稳定的实验批次体系、高效的数据处理链路和可长期迭代的标准化数据资产。因此,DNA甲基化芯片的价值也被重新评估,它不仅仅是一种检测工具,更像是一套可积累的表观组学数据基础设施,支撑队列研究、表观遗传时钟、风险评分、疾病分类等科研转化。
未来,甲基化研究的核心价值将聚焦于数据的稳定性、可解释性与长效复用能力,推动表观遗传学从基础发现全面落地于精准医学领域。
参考文献:(滑动查看)
1.Illumina. Infinium Array Product Line: The Infinium Assay Workflow. Accessed August 2026.
2.Aryee MJ, Jaffe AE, Corrada-Bravo H, et al. Minfi: a flexible and comprehensive Bioconductor package for the analysis of Infinium DNA methylation microarrays. Bioinformatics. 2014;30(10):1363–1369. doi:10.1093/bioinformatics/btu049.
3.Xu Z, Niu L, Li L, Taylor JA. ENmix: a novel background correction method for Illumina HumanMethylation450 BeadChip. Nucleic Acids Research. 2016;44(3). doi:10.1093/nar/gkv907.
4.Zhou W, Triche TJ Jr, Laird PW, Shen H. SeSAMe: reducing artifactual detection of DNA methylation by Infinium BeadChips in genomic deletions. Nucleic Acids Research. 2018;46(20). doi:10.1093/nar/gky691.
5.Kaur D, Lee SM, Goldberg D, et al. Comprehensive evaluation of the Infinium Human MethylationEPIC v2 BeadChip. Epigenetics Communications. 2023;3:6. doi:10.1186/s43682-023-00021-5.
6.Bińkowski J, Wojdacz TK. DNA methylation biomarkers-based pan-cancer classifier: predictive modeling for cancer classification. Genome Medicine. 2026;18:66. doi:10.1186/s13073-026-01650-w.
7.Sadikovic B, Levy MA, Kerkhof J, et al. Clinical epigenomics: genome-wide DNA methylation analysis for the diagnosis of Mendelian disorders. Genetics in Medicine. 2021;23(6):1065–1074. doi:10.1038/s41436-020-01096-4.
8.Min JL, Hemani G, Hannon E, et al. Genomic and phenotypic insights from an atlas of genetic effects on DNA methylation. Nature Genetics. 2021;53:1311–1321. doi:10.1038/s41588-021-00923-x.
9.Salas LA, Zhang Z, Koestler DC, et al. Enhanced cell deconvolution of peripheral blood using DNA methylation for high-resolution immune profiling. Nature Communications. 2022;13:761. doi:10.1038/s41467-021-27864-7.
10.Belsky DW, Caspi A, Corcoran DL, et al. DunedinPACE, a DNA methylation biomarker of the pace of aging. eLife. 2022;11. doi:10.7554/eLife.73420.
11.Waziry R, Ryan CP, Corcoran DL, et al. Effect of long-term caloric restriction on DNA methylation measures of biological aging in healthy adults from the CALERIE trial. Nature Aging. 2023;3:248–257. doi:10.1038/s43587-022-00357-y.
12.García-Calzón S, Maguolo A, Eichelmann F, et al. Epigenetic biomarkers predict macrovascular events in individuals with type 2 diabetes. Cell Reports Medicine. 2025;6(8):102290. doi:10.1016/j.xcrm.2025.102290.
13.Gadd DA, Hillary RF, McCartney DL, et al. Epigenetic scores for the circulating proteome as tools for disease prediction. eLife. 2022;11. doi:10.7554/eLife.71802.
14.Zhuang BC, Jude MS, Konwar C, et al. Accounting for differences between Infinium MethylationEPIC v2 and v1 in DNA methylation-based tools. Life Science Alliance. 2025;8(9). doi:10.26508/lsa.202403155.
因美纳《表观新见》系列报道之“甲基化数据的T2D研究应用”
扫描下方二维码,观看专家观点
01|
02|
03|
04|
快点亮"在看”吧!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.