![]()
蛋白质是生命活动的重要执行分子,参与细胞信号传递、免疫调控、代谢稳态以及疾病发生发展等关键生物过程。过去二十余年,全基因组关联研究(Genome-wide Association Study, GWAS)在复杂疾病遗传机制研究中取得了巨大进展,发现了大量与疾病风险相关的遗传位点。然而,由于绝大多数疾病相关遗传变异位于非编码区域,这些遗传信号如何影响分子功能,并进一步导致疾病表型改变,仍然是人类遗传学领域的重要挑战。
随着高通量蛋白质组学技术、大规模人群队列以及数据分析手段的发展,人群分析中的蛋白质基因组学(Proteogenomics)逐渐成为连接遗传变异、分子调控机制和疾病表型的重要研究方向。其中,蛋白质数量性状位点(Protein Quantitative Trait Loci,pQTL)研究通过系统解析遗传变异与蛋白质水平之间的关系,为理解人体蛋白质遗传调控结构、发现疾病相关分子机制、以及筛选潜在有效的治疗靶点提供了新的研究框架。
2026年8月20日, 西湖大学统计医学遗传学实验室沈侠博士团队联合诺和诺德(NovoNordisk)科学副总裁Anders Mälarstig博士共同 在Nature Reviews Genetics上发表了 综述文章Proteogenomics in human populations”在线发表于。 该综述系统回顾了近年来人类群体蛋白质基因组学的发展历程,围绕pQTL研究策略、大规模人群蛋白质组学资源、蛋白质遗传调控结构,以及蛋白质基因组学在疾病机制解析和精准医学中的应用进行了全面总结,并进一步讨论了未来该领域的发展方向。
![]()
从遗传变异到蛋白质功能:pQTL解析人体蛋白质遗传调控
GWAS已经发现了大量复杂疾病相关遗传信号,但如何进一步明确这些遗传变异影响哪些分子过程,是理解疾病机制的重要环节。
蛋白质作为生命活动的重要功能分子,处于遗传信息传递链条中更加接近表型的一层。与基因表达等转录水平分子表型相比,蛋白质丰度不仅受到转录调控影响,还受到翻译效率、蛋白质加工、分泌运输、降解以及翻译后修饰等多个过程共同调节。因此,蛋白质水平能够提供部分RNA层面无法捕获的信息,为连接遗传变异和疾病表型提供更加直接的分子证据。
pQTL研究通过整合个体遗传信息和蛋白质组测量数据,系统鉴定影响蛋白质丰度的遗传变异。随着技术的发展,人群蛋白质基因组学已经形成了一套完整的研究体系:首先利用质谱(Mass spectrometry, MS)或基于亲和捕获的蛋白质检测平台(如Olink和SomaScan)获得大规模蛋白质组数据;随后通过全基因组关联分析识别影响蛋白质水平的遗传位点;进一步结合精细定位(Fine-mapping)、功能注释、共定位分析(Colocalization)以及孟德尔随机化(Mendelian randomization,MR)等方法,解析遗传变异、蛋白质调控和疾病表型之间的潜在联系(图1)。
![]()
图1. 人群蛋白质基因组学研究流程示意图
根据遗传作用范围,pQTL通常可以分为cis-pQTL和trans-pQTL。cis-pQTL位于目标蛋白质编码基因附近,通常更可能直接影响蛋白质水平,因此在功能解释和因果推断中具有重要价值;trans-pQTL则作用于远距离区域,虽然调控机制更加复杂,但能够揭示蛋白质调控网络以及系统性生物过程。
从遗传关联到疾病机制:pQTL推动蛋白质因果推断
建立pQTL资源不仅能够描绘人体蛋白质遗传调控图谱,更重要的是能够帮助研究者进一步回答一个关键问题:某个蛋白质水平变化是否真正参与疾病发生发展?
近年来,pQTL研究逐渐从单纯的遗传关联分析发展到基于遗传证据的功能解析阶段。文章系统总结了利用pQTL开展蛋白质因果推断的方法框架。其中,cis-pQTL由于位于目标蛋白质编码基因附近,通常具有更加明确的生物学解释,因此被认为是蛋白质孟德尔随机化分析中更加可靠的遗传工具。然而,在利用pQTL进行MR分析之前,需要首先判断蛋白质关联信号与疾病GWAS信号是否来源于相同遗传变异。
共定位分析可以帮助研究者判断蛋白质水平和疾病风险是否共享同样的遗传关联信号,从而避免由于连锁不平衡或遗传多效性导致的错误解释。在确认具有共享遗传基础后,进一步利用MR分析可以评估遗传预测的蛋白质水平变化对疾病表型的潜在因果影响。
因此,当前蛋白质因果推断的研究策略通常包括三个关键步骤:选择可靠的pQTL遗传工具、验证蛋白质与疾病之间的遗传共定位关系,以及利用MR估计因果效应大小。蛋白质因果推断需要综合遗传关联、共定位证据以及效应估计结果进行解释,而不能仅依赖单一统计方法。
大规模蛋白质组学资源推动蛋白质基因组学进入新时代
蛋白质基因组学的发展离不开大规模人群资源和高通量检测技术的推动。早期pQTL研究受到蛋白质检测数量和样本规模限制,主要集中于少量候选蛋白质。近年来,随着Olink、SomaScan以及质谱等平台的发展,研究者已经能够在数万甚至更大规模的人群中同时检测数千种蛋白质,使系统解析人体蛋白质遗传结构成为可能。
多个大型人群蛋白质组学项目推动了这一领域快速发展。例如,deCODE Genetics利用冰岛人群资源开展大规模蛋白质遗传研究,发现了大量蛋白质调控信号;UK Biobank Pharma Proteomics Project(UKB-PPP)在超过5万名参与者中检测数千种血浆蛋白质,建立了目前规模最大的蛋白质遗传调控资源之一;SCALLOP Consortium等国际合作项目进一步整合多个队列,提高了pQTL发现能力。
然而,pQTL发现能力并不仅仅取决于样本量大小。不同蛋白质检测平台由于检测原理、蛋白质覆盖范围、测量灵敏度以及技术特性的差异,在pQTL发现效率方面也存在明显不同。总体而言,随着样本量增加,能够检测到cis-pQTL的蛋白质比例通常提高,但不同平台之间仍存在明显差异。这提示pQTL研究结果不仅受到统计效能影响,也受到蛋白质检测技术、蛋白质覆盖范围以及测量准确性的共同影响。因此,在未来开展大规模蛋白质基因组学研究时,除了扩大样本规模外,还需要综合考虑蛋白质检测平台特点、数据质量以及不同技术之间的数据整合策略。
蛋白质基因组学助力精准医学和药物研发
建立大规模pQTL资源的重要价值之一,是利用遗传信息进一步理解疾病发生机制,并推动精准医学和药物研发。通过整合pQTL数据与疾病GWAS结果,研究者可以寻找潜在疾病介导蛋白质,并利用遗传证据优先筛选具有治疗潜力的候选靶点。
基于pQTL的研究已经帮助解析多个疾病相关的分子机制。例如,具有强cis遗传调控证据的蛋白质能够提供更加可靠的遗传工具,用于评估蛋白质水平变化与疾病风险之间的关系,并辅助药物靶点优先排序。
与此同时,文章也指出,未来蛋白质基因组学仍面临多个挑战,包括不同蛋白质检测平台之间的数据整合、多祖源人群资源不足、蛋白质之间相互作用与蛋白质复合物的定量难度、组织和细胞类型特异性蛋白质调控机制解析,以及如何结合人工智能等新兴技术进一步挖掘多组学数据价值。
随着更多组织来源、多祖源人群以及多维度组学数据的积累,蛋白质基因组学将进一步推动从遗传发现到疾病机制解析,推动新药研发与精准治疗策略的发展。
综上, 本综述系统回顾了人类群体蛋白质基因组学的发展历程,梳理了蛋白质遗传学研究从遗传信号发现、蛋白质调控解析,到疾病机制研究和治疗靶点发现的完整研究框架,并展望了该领域未来的发展方向。
西湖大学医学院/西湖大学医学院附属杭州市第一人民医院沈侠研究员为通讯作者,翟然然博士为第一作者,诺和诺德科学副总裁Anders Mälarstig博士为合著者。
文章链接:
https://doi.org/10.1038/s41576-026-00998-4
制版人: 十一
学术合作组织
(*排名不分先后)
![]()
战略合作伙伴
(*排名不分先后)
推荐直播
转载须知
【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
![]()
点击主页推荐活动
关注更多最新活动!
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.