慢性疾病已成为全球医疗系统和社会面临的重大负担,由于其发病机制涉及遗传与环境因素之间复杂的相互作用,因此有效预测风险并实施早期筛查仍具挑战性。现有多基因风险评分仅能解释部分遗传风险,无法纳入环境因素的作用。相比之下,血浆蛋白质参与机体绝大多数生理调控过程,其动态变化反映了遗传易感性、环境暴露、生活方式和衰老等多种致病因素的联合效应,可作评估个体健康状态和疾病风险的理想窗口。尽管已有多种蛋白质组风险评分问世,但传统分析方法难以应对高维特征间的复杂非线性关系,且缺乏针对大规模血浆蛋白质组数据的专用预训练模型。
近日,中国哈尔滨工业大学王亚东、胡杨团队与北京大学余灿清、北京脑重大疾病研究院刘桂友团队合作,构建了基于BERT架构的血浆蛋白质组预训练模型ProLM;该模型可捕捉人体基线水平下各类蛋白的关联规律,并支持对16种常见慢性病进行风险预测。在对特定疾病进行微调后,ProLM衍生的蛋白质组风险评分ProRS预测性能在所有16种疾病上优于“年龄+性别”基线模型;在14种疾病上优于心血管疾病(ASCVD)风险方程;在11种疾病上优于包含35个变量的临床PANEL评分。此外,该模型解析结果还揭示了GDF15等关键蛋白质,其表达水平在临床确诊前15年即出现显著变化;研究在中国慢性病前瞻性队列(中国嘉道理生物样本库,CKB)中完成外部独立验证。总之,ProLM为基于蛋白质组学的慢性病早期风险分层提供全新工具。相关内容发表在Nature Communications。
![]()
研究设置三类独立人群数据集,分别用于模型预训练、疾病微调与外部验证。预训练队列为英国生物样本库血浆蛋白质组学项目(UKB-PPP)中15,499名基线无慢性病个体,包含2,873种血浆蛋白检测数据,所有参与者在长达15.5年随访中未新发相关疾病。微调队列由随访期间新发16种常见慢性病(神经、呼吸、内分泌及癌症等)的患者与1,723名健康对照组成,其中原发性高血压和肥胖最为多发,其年龄、BMI及死亡率均高于预训练队列;并纳入痴呆、卒中、炎症性肠病和糖尿病四类疾病亚型数据进行精细微调。外部验证采用中国CKB队列,该人群BMI更低、吸烟率和死亡率更高。
ProLM的核心架构基于BERT编码器,针对血浆蛋白质组学连续数值特征,设计了专属Hadamard积嵌入方式与容差掩码重构预训练任务。预训练输入融合蛋白功能序列、功能信息,并引入蛋白互作矩阵优化注意力权重,模型经过99轮迭代收敛,重构准确率达0.8509。模型可解释性方面,积分梯度显示预测权重高度集中于少数核心蛋白(FOLR3、ERP29等),扰动实验证实这些蛋白对重建性能影响显著。无标签零样本测试证实,该模型仅依靠蛋白嵌入特征即可区分人群性别、年龄分层,证明模型可自主捕捉与人群基本特征相关的蛋白表达模式。
![]()
图1. ProLM模型架构
接下来,研究团队使用微调数据集对ProLM进行微调以预测慢性病。结果显示,仅解冻最后8层编码器并训练40轮,模型即取得最优性能,其蛋白嵌入特征可区分患者与健康人群。在16种慢性病中,相较多种主流机器学习与深度学习模型,该模型在10种疾病中AUC表现优异;对14种疾病的AUC超0.8,其中痴呆、心衰、前列腺癌等多种高发慢性病AUC超0.9。
基于ProLM的发病预测概率,研究团队定义了蛋白质组风险评分ProRS,将个体划分为高(>0.66)、中(0.33~0.66)、低(<0.33)风险三组。生存分析显示,三组人群疾病发病轨迹差异显著,高风险组发病风险较低风险组至少高出16倍;该分层效应在不同阈值定义下均保持稳定。进一步,采用Cox比例风险模型评估ProRS区分性能,发现12种疾病的10年预测C指数超0.7,其中肺癌、帕金森病尤为突出。与三类临床传统评分相比,该模型对全部16种疾病预测能力优于年龄+性别模型,在14种疾病上预测优于ASCVD,在11种种疾病上预测优于PANEL,且预测效果在不同时间窗口保持稳定。
在ProRS基础上加入临床信息,多数疾病的判别性能无显著提升,这提示ProRS本身已包含了丰富的预测信息。此外,模型校准曲线和决策曲线证实,ProRS风险预估贴合真实发病事件,净临床获益高于传统临床评分。
![]()
图2. 基于ProRS的发病风险分层
利用微调后模型的注意力权重矩阵,研究团队为每种疾病识别出贡献最大的前5种蛋白。GDF15在8种慢性疾病中均被列为高权重蛋白,包括痴呆、糖尿病、心血管疾病等,提示其可能作为多种慢性疾病的共同生物标志物;CCN5、ADM和EDA2R也在超过5种疾病中排名靠前。以痴呆和2型糖尿病(T2D)为例,两类疾病的核心高权重蛋白如GFAP、NEFL、GDF15、REN、CDH2、REN等,多数已有文献报道其与疾病相关,且属于可成药基因靶点。通过FinnGen数据库的GWAS复现分析,GDF15为2型糖尿病全基因组显著位点,REN、GFAP、GDF15分别与糖尿病、痴呆风险存在关联,英国队列与芬兰人群中各蛋白效应方向完全一致。
![]()
图3. 具有模型优先性的蛋白质
研究团队绘制了痴呆或T2D中权重最高血浆蛋白在临床诊断前15年内的纵向轨迹,并与年龄和性别匹配的健康对照进行比较。结果显示,后续发病个体的多个关键蛋白在诊断前15年就已出现表达异常,高权重蛋白的表达水平均显著高于健康人群。CDH2、GDF15、VSIG2、REN和LGALS4在T2D诊断前15年内呈现明显的单调上升趋势,GFAP、NEFL、WNT9A和GDF15在痴呆诊断前15年内也呈现类似的单调上升趋势。这一发现提示血浆蛋白异常可能远早于临床症状出现,为极早期筛查提供了潜在靶点。
![]()
图4. 疾病诊断前模型优先的血浆蛋白的时间轨迹
此外,在四种疾病的亚型分类任务中,ProLM在糖尿病二分类亚型(1型与2型)中表现较好,AUC达0.8526,但在痴呆、卒中多等亚型多分类任务预测性能偏弱,AUC分别为0.6449、0.5924。消融实验表明,移除蛋白序列/功能嵌入或蛋白互作偏置矩阵均会导致模型预训练训练重构、疾病预测性能下降,证实了多模态信息融合和生物学先验的重要性。
最后,研究团队基于CKB队列完成独立东亚人群验证。结果显示,ProLM对心肌梗死(AUC=0.7901)、冠心病(0.7677)、T2D(0.8221)、慢性阻塞性肺病(0.7634)和卒中(0.7415)均保持了良好的预测性能,证明了模型在不同人群中的泛化能力。
![]()
图5. 疾病亚型分类任务中嵌入的t-SNE可视化
ProLM是首个专为普通人群血浆蛋白质组学设计的预训练模型,无需临床信息即可实现多种慢性病的风险分层,其判别能力优于传统临床评分,且关键蛋白标志物在诊断前十余年即呈现可检测的变化,为疾病早期预警提供了全新的分子工具。
参考文献:
https://www.nature.com/articles/s41467-026-75507-6
01
02
03
04
05
快点亮"在看”吧!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.