治疗性多肽药物因其高活性、高选择性以及较低的毒性和免疫原性,在内分泌、代谢和肿瘤等疾病领域备受关注。寡肽作为其中的重要类别,序列较短(4–10个氨基酸),具有合成便捷、成本效益高等优势。然而,AI驱动的多肽发现长期集中于抗菌肽、抗癌肽等拥有海量训练数据的领域,代谢、内分泌和组织再生等疾病场景因缺乏已验证的活性肽数据,面临严重的“路灯效应”——数据丰富的领域模型越来越强,数据稀缺的适应证则难以建立可靠预测器。
针对这一瓶颈,近日,张永彪(北京航空航天大学)、李占占(河南中医药大学)、MartinCheung(香港大学)和肖百川(清华大学)作为共同通讯作者在Cell Reports Methods发表题为A deep learning framework for oligopeptide candidate discovery across metabolism-related contexts的研究论文。该研究提出了一种无需适应证特异性训练数据的通用深度学习框架Deepeptide,通过整合疾病生物学知识,从蛋白质“暗物质”中发掘具有治疗潜力的寡肽先导化合物。
![]()
Deepeptide的设计逻辑绕开了“直接学习什么样的肽能治疗某种疾病”这一数据依赖路径,转而利用“疾病适应证—生物过程—分子功能”之间的内在联系。研究人员首先通过疾病关键词(如“angiogenesis”“lipid metabolism”)在Gene Ontology等数据库中确定与该适应证相关的生物过程,筛选出具有改善作用的分子功能,再利用功能预测模型从人、小鼠和大鼠的全部蛋白质组成的“蛋白质宇宙”中,筛选具有相应功能的内在无序区(IDRss),构建适应证特异性的“原肽”库。
在寡肽提取与功能推断阶段,Deepeptide采用蛋白质语言模型ESM-2编码序列,双向长短期记忆网络(Bi-LSTM)捕获上下文关系,条件随机场(CRF)按照B、I、E、O标签识别潜在生物活性肽的边界。获得候选生物活性寡肽后,研究团队进一步依据其在目标功能IDRs中的富集程度和功能评分进行排序,同时综合评估溶解性、预测毒性和序列新颖性,最终筛选高排名候选进行湿实验验证。
研究人员将Deepeptide应用于血管生成、脂质代谢、成骨、葡萄糖代谢和抗血管生成五种代谢相关场景。整体上,62%的实验候选表现出显著生物活性,多数活性可达到相应基准治疗药物的水平。最具代表性的两个候选分子在动物模型中表现突出:七肽AP7在小鼠创伤模型中表现出与VEGF相当的促血管生成和伤口修复能力;六肽TP6则在高脂饮食诱导的肥胖小鼠中同时改善肥胖和高脂血症,展现出双重代谢调控潜力。值得注意的是,这些候选寡肽均来自此前未被充分研究的蛋白质区域,序列新颖性高,提示了潜在的未知作用机制。
该研究的核心突破在于方法学层面的范式转变:通过将疾病知识、蛋白质功能和深度学习相整合,Deepeptide证明了即使在没有适应证特异性阳性数据的情况下,也能构建可靠的AI寡肽发现管线。这一策略为数据稀缺的代谢相关适应证提供了可推广的解决方案,也为从蛋白质“暗物质”中系统挖掘治疗性短肽开辟了新路径。当然,该框架目前仍依赖于已知的疾病相关生物过程,对于生物学机制尚不清晰的适应证适用性有限;同时,由于富集策略对长肽的统计效力较低,Deepeptide更适用于寡肽而非长链多肽的发现。这也是作者团队在后续研究中拟继续完善的地方。
原文链接:https://doi.org/10.1016/j.crmeth.2026.101577
制版人:十一
学术合作组织
(*排名不分先后)
![]()
推荐直播
转载须知
【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.