近日,滑铁卢大学李明教授、清华大学邓海腾教授团队,在《自然·生物技术》发表研究长文,推出名为RNovA的深度学习算法。该系统首次在无需预定义修饰列表或重新训练的前提下,实现了对未知翻译后修饰的开放式发现,并在类风湿关节炎患者样本和一种缺乏参考蛋白质组的未知细菌中成功验证了其能力。
![]()
传统的蛋白质测序方法长期依赖数据库比对,只能识别已知序列和已注释的修饰类型。即使是当前最先进的深度学习模型,面对训练数据中未出现过的稀有修饰时,也会失效。而真实生物学场景中,从乳酸化到维生素C偶联,不断有新发现的修饰被证明在免疫调节、代谢重编程中发挥关键作用。研究团队认为,这种“封闭世界”的假设已严重制约了蛋白质组学的探索边界。
RNovA的核心创新在于其双模块设计与相对位置编码的巧妙融合。系统首先通过“路径搜索器”在质谱图中寻找可能的碎片离子路径,输出由节点质量构成的序列——其中可包含与标准氨基酸不匹配的未知质量标签。随后,“序列填充器”利用旋转位置嵌入技术,动态评估候选残基与谱图证据的匹配程度,在无需针对特定修饰微调模型的情况下,直接输出完整肽段序列。团队进一步设计了自动化的质量标签聚类模块,能从数据中直接识别统计富集的修饰模式,实现从原始谱图到完整序列的端到端解析。
![]()
在包含三种模式生物的标准数据集上,RNovA的肽段召回率最高达到82.11%,氨基酸召回率超过90%,整体性能超越现有主流工具。更关键的验证来自含有多种翻译后修饰的合成肽段数据集:尽管训练数据中仅包含乙酰化和磷酸化两种修饰类型,RNovA对其他七种从未见过的修饰(如巴豆酰化、琥珀酰化、瓜氨酸化)仍保持了高精度的识别能力。在酪氨酸磷酸化修饰上,其氨基酸精度达到95.44%,远高于传统工具PEAKS的86.87%。该团队还采用了15N稳定同位素标记和靶-诱饵谱图双重策略,确保假发现率控制在1%以内。
在真实临床样本中,研究团队分析了类风湿关节炎患者的滑膜组织。RNovA的开放搜索能力发现了一个富集的质量偏移簇,经BLAST比对和合成肽段验证,确认其为色氨酸到犬尿氨酸的氧化修饰——一种与免疫调节密切相关但难以通过常规方法检出的稀有修饰。在另一项更极端的测试中,团队分析了一株缺乏参考蛋白质组数据库的细菌分离株A1232E。系统在无任何先验信息的情况下,识别出谷氨酸残基上携带+43.04 Da的质量偏移,并预测其可能为乙醇胺修饰。合成肽段的共洗脱和谱图比对完全验证了这一从未被注释过的修饰的存在。
READING
BioPeers
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.