来源:市场资讯
(来源:DrugAI)
电子健康记录(Electronic Health Records,EHR)完整记录了患者在生命历程中的疾病发生、发展和诊疗过程,为研究疾病演化规律提供了前所未有的数据资源。然而,目前大多数分析方法仍将疾病作为彼此独立的事件处理,很少同时考虑疾病之间长期共存关系及遗传因素的共同作用,因此难以准确揭示个体健康状态随年龄变化的动态规律。
研究人员提出了一种新的贝叶斯生成框架——ALADYNOULLI,首次将纵向电子健康记录、年龄信息以及多基因风险评分统一纳入同一个概率模型中,学习患者在生命历程中不断变化的潜在疾病特征,并估计每位患者对应不同疾病特征的动态权重。模型能够自然处理多种疾病同时存在、慢性疾病持续发展以及疾病之间相互影响等复杂情况。
研究人员分别在英国生物样本库(UK Biobank)、Mass General Brigham Biobank以及All of Us三项大型生物医学队列中进行了验证,总样本超过68万人,最长随访时间达到52年,共覆盖348种疾病。模型稳定识别出21种具有高度重复性的疾病特征,不仅揭示了同一疾病内部存在的重要生物学亚型,还通过疾病特征开展全基因组关联分析,新发现151个显著遗传位点,其中多个心血管相关位点是传统单疾病分析未能发现的。同时,该模型在一年及十年疾病风险预测方面均优于现有经典临床风险模型,为精准医学中的疾病预测、遗传发现以及患者分层提供了新的分析框架。
![]()
人体疾病并不是彼此孤立发生的,而是在遗传背景、生活环境以及既往疾病共同作用下不断演化。不同个体不仅患病风险不同,同一种疾病在不同年龄阶段的发展轨迹也存在巨大差异。如果能够全面理解这种长期动态变化过程,将有助于疾病早期筛查、精准预防以及个体化治疗。
近年来,大规模电子健康记录与基因组数据逐渐积累,为系统研究疾病演化提供了丰富的数据基础。然而,这类数据具有明显特点:疾病种类繁多、时间跨度长、患者之间存在显著异质性,而且遗传因素与疾病发展彼此交织。目前常用分析方法通常针对单个疾病建立模型,或者仅分析疾病之间的两两关系,很难同时描述数百种疾病在几十年生命周期中的共同演化过程。
已有一些聚类方法尝试寻找疾病共病模式,但大多数忽略了年龄带来的时间变化,也无法同时考虑遗传风险对于疾病发展的长期影响。因此,一个能够同时整合纵向电子健康记录和遗传信息,并刻画疾病动态演化的新型模型,一直是精准医学领域的重要挑战。
为了解决这一问题,研究人员提出ALADYNOULLI。与传统方法不同,它并不直接预测单一疾病,而是学习隐藏在多个疾病背后的潜在疾病特征。这些疾病特征反映的是不同生物学过程,例如心血管、代谢、炎症或肿瘤等系统状态。每位患者随着年龄增长,在不同疾病特征上的权重不断变化,由此形成个体独特的健康轨迹。这种表示方式不仅能够解释疾病之间的共病关系,还能借助常见疾病的信息提高罕见疾病预测能力,同时直接融合遗传信息,使模型既具有较强解释性,又兼具预测能力。
方法
研究人员构建了贝叶斯生成模型ALADYNOULLI,将患者整个生命过程中的疾病发生记录表示为多个潜在疾病特征共同作用的结果。模型同时学习两个核心变量:一是群体层面的疾病特征,即不同疾病随年龄变化的风险模式;二是个体层面的疾病特征权重,用于描述每位患者在不同年龄阶段属于各种疾病特征的程度。研究人员进一步将36种多基因风险评分、性别及遗传主成分共同引入高斯过程模型,使遗传因素直接影响疾病特征的动态演化。整个模型既能够处理疾病长期共存,又能够预测未来疾病发生风险,并利用统一的似然函数实现偏倚校正。随后,研究人员分别利用英国生物样本库、Mass General Brigham及All of Us三项独立队列进行训练和外部验证,对348种疾病进行了联合建模,并进一步开展遗传关联分析和疾病风险预测。
结果
ALADYNOULLI能够稳定学习疾病演化特征
研究人员首先利用三项独立大型队列评估模型学习得到的疾病特征是否具有稳定性。尽管三个队列在人群组成、医疗系统以及疾病编码方式上均存在明显差异,模型仍稳定识别出21种潜在疾病特征,其中包括心血管、代谢、肺部、精神疾病、骨骼肌肉系统、肿瘤等多个主要疾病类别。
这些疾病特征不仅具有清晰的疾病组成,而且能够反映疾病随年龄不断变化的风险轨迹。例如,在缺血性心血管疾病特征中,房颤和心力衰竭风险自55岁以后持续升高;而肿瘤特征则主要在60至75岁之间迅速增加,并进一步发展为转移性疾病。更重要的是,这些年龄变化规律完全由模型自动学习得到,而不是人为设定。
研究人员进一步比较三个独立队列对应疾病特征的组成一致性,发现疾病组成保存率中位数达到约80%,说明这些疾病特征具有良好的跨队列重复性,能够反映稳定存在的疾病生物学规律,而不是来源于某一个医疗系统的数据特点。
![]()
图1:ALADYNOULLI总体框架,包括患者生命周期疾病轨迹、潜在疾病特征、个体疾病特征权重及疾病风险预测流程。
![]()
图2:21种潜在疾病特征的年龄动态变化、不同疾病组成及三项独立队列之间的一致性验证。
疾病内部存在显著异质性
模型不仅能够学习总体疾病规律,还能够刻画不同患者之间的个体差异。研究人员发现,即使具有相同临床诊断,不同患者对应的潜在疾病特征也可能完全不同。
以心肌梗死为例,早发患者在心血管疾病特征上的贡献更高,并且疾病特征在发病前几年快速增加;相比之下,晚发患者则表现出更加缓慢的发展轨迹。这说明相同疾病可能来源于不同的生物学过程,因此未来可能需要采取不同的预防策略。
随后,研究人员分别对心肌梗死、乳腺癌以及重度抑郁症患者进行聚类分析。结果显示,每一种疾病都可以进一步划分为多个具有不同疾病特征组成的患者亚群。例如,在抑郁症患者中,一部分患者同时伴有明显炎症、哮喘、偏头痛及肥胖等疾病特征;而另一部分患者则具有完全不同的疾病组成。乳腺癌患者同样表现出明显的妇科疾病和炎症相关特征差异。
这些亚群之间不仅疾病特征差异巨大,而且统计学显著性极高,说明传统疾病诊断实际上掩盖了大量潜在生物学异质性。通过疾病特征而非疾病名称描述患者,能够更加真实地反映疾病发展的内在机制。
![]()
图3:患者生命周期疾病轨迹、早发与晚发心肌梗死比较,以及不同疾病内部潜在亚型分析。
遗传学分析揭示新的疾病生物学机制
ALADYNOULLI最大的特点之一是将遗传信息直接整合到疾病动态模型之中,而不是像传统方法那样在疾病分析结束后再单独进行遗传关联研究。研究人员利用36种经过验证的多基因风险评分,对不同疾病特征进行了系统分析。
结果显示,大多数疾病特征都具有明确的遗传基础,共发现116组显著的多基因风险评分—疾病特征关联。其中,冠心病多基因风险评分与心血管疾病特征之间的关联最为显著,低密度脂蛋白胆固醇风险评分同样高度富集于心血管疾病特征,而2型糖尿病多基因风险评分则主要作用于代谢疾病特征。这说明模型学习得到的潜在疾病特征不仅来源于临床表现,同时也具有明确的遗传学基础。
随后,研究人员利用疾病特征而非单个疾病开展全基因组关联分析。相比传统GWAS仅分析某一种疾病,疾病特征综合了多个相关疾病的信息,因此能够提高遗传信号的检测能力。最终,21种疾病特征共发现151个达到全基因组显著性的遗传位点。其中,仅心血管疾病特征就发现56个主要位点,包括LPA、APOE、PCSK9等经典脂质代谢基因,同时还发现了IL6R、SCARB1、SMAD3、PDGFD等多个传统单疾病GWAS未能识别的重要位点。
研究人员进一步开展罕见变异关联分析,同样获得大量具有明确生物学意义的结果。例如,LDLR、APOB、LPA等基因主要与心血管疾病特征相关;TTN与心力衰竭和心律失常特征密切相关;BRCA2则与乳腺癌相关疾病特征一致。这些结果说明,通过多个相关疾病共同建立疾病特征,能够揭示传统单疾病分析容易遗漏的共同遗传机制,提高复杂疾病遗传发现能力。
为了进一步验证模型学习结果,研究人员分析了具有明确遗传背景的人群。例如,家族性高胆固醇血症患者由于携带LDLR、APOB或PCSK9等基因突变,因此理论上应表现出更强的心血管疾病特征。结果发现,这部分患者在首次心血管事件发生前数年,心血管疾病特征明显高于普通人群。同样,携带CHIP相关突变的个体也表现出更高的炎症相关疾病特征,与目前已知的生物学机制完全一致。这些结果进一步证明,模型学习得到的疾病特征具有真实的生物学意义,而不仅仅来源于统计相关性。
![]()
图4:疾病特征GWAS与罕见变异分析结果、不同患者亚群多基因风险评分分布以及疾病特征对应遗传结构。
动态疾病预测优于传统临床模型
除了疾病发现之外,研究人员进一步验证ALADYNOULLI在疾病风险预测中的表现。
与传统风险模型通常只利用患者当前状态不同,ALADYNOULLI能够持续利用患者整个生命过程中不断积累的疾病信息,因此能够动态更新未来患病风险。研究人员按照真实临床应用方式,在不同时间点分别预测未来一年及未来十年的疾病发生风险,并严格避免未来信息泄露。
结果表明,对于动脉粥样硬化性心血管疾病、乳腺癌、房颤、心力衰竭、帕金森病等多种疾病,模型均取得较高预测准确率。其中,一年期预测中,心血管疾病预测准确率接近0.88,乳腺癌约0.78,房颤约0.80,心力衰竭约0.77;十年长期预测虽然难度更高,但模型仍保持较好的预测性能。
研究人员进一步将模型与目前广泛使用的Pooled Cohort Equation(PCE)、PREVENT、QRISK3、Gail模型以及传统Cox回归进行了直接比较。结果显示,在一年预测和十年预测中,ALADYNOULLI均明显优于这些经典风险模型。例如,在ASCVD预测中,无论男性还是女性,模型均取得更高的预测准确率;在乳腺癌预测中,明显优于Gail模型;在类风湿关节炎或乳腺癌等高风险患者中,对未来心血管事件的预测优势更加明显。
更重要的是,ALADYNOULLI并不依赖血脂、生化指标或其他专门检查,仅利用临床日常产生的诊断编码即可完成预测,因此更加适合真实医疗场景的大规模部署。
研究人员还发现,模型预测概率与真实疾病发生率具有极高一致性,在超过7亿个患者—时间点组合中,预测发生率几乎与实际发生率完全吻合,说明模型不仅具有较高区分能力,同时具有良好的校准性能,预测结果能够真实反映未来患病概率。
![]()
图5:ALADYNOULLI一年及十年疾病风险预测结果,与PCE、PREVENT、QRISK3、Gail及Cox模型比较,以及模型校准分析。
研究人员提出的ALADYNOULLI建立了一种新的纵向疾病建模范式,实现了电子健康记录、年龄信息和遗传背景的统一建模。不同于传统针对单一疾病建立预测模型的方法,该模型以潜在疾病特征为核心,同时学习数百种疾病在整个生命历程中的共同演化规律,从而能够更加全面地描述人体健康状态的动态变化。
研究结果表明,这些潜在疾病特征不仅具有稳定的跨队列重复性,而且能够揭示传统疾病分类内部隐藏的重要生物学亚型。通过疾病特征开展遗传分析,模型进一步发现了传统GWAS未能识别的新遗传位点,并验证了家族性高胆固醇血症、CHIP等具有明确遗传背景疾病中的生物学一致性,说明疾病特征比单一疾病更接近真实生物学机制。
与此同时,ALADYNOULLI能够持续整合患者不断增加的诊疗信息,动态更新疾病风险,在多个常见疾病上的预测性能均超过现有经典临床模型,为未来精准医学提供了更加统一、可解释且具有遗传学基础的预测框架。
研究人员也指出,目前模型仍主要依赖电子健康记录数据,因此不可避免受到诊断编码、医疗行为及数据完整性的影响。虽然模型通过逆概率加权能够校正部分选择偏倚,但生活方式、环境暴露等重要危险因素尚未纳入分析。此外,目前模型仍采用线性遗传效应和疾病特征加和等假设,对于更加复杂的基因—环境互作仍有进一步改进空间。
总体而言,ALADYNOULLI展示了贝叶斯生成模型在纵向医学数据分析中的巨大潜力。未来若进一步结合医学影像、多组学数据、可穿戴设备监测信息以及大型医学基础模型,将有望建立覆盖整个生命历程的数字健康画像,实现疾病风险预测、患者精准分层、遗传发现和个体化治疗的一体化分析,为精准医学的发展提供新的技术基础。
整理 | 王建民
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.