科学家开发了两个AI模型,通用细胞嵌入(UCE)和“TranscriptFormer”。后者学习了12个物种、共1.12亿个细胞的基因表达数据。两者共同构建“通用空间”,让跨物种比较细胞变得容易得多,也为人类疾病研究和细胞治疗带来新线索。
相关成果已发表在《自然》和《科学》杂志上。项目共同主要作者、美国斯坦福大学生物工程教授斯蒂芬·奎克表示,希望这两篇论文能代表一个全新领域的开始,而后面还有十年工作等着全球生物学家去做。
每个细胞都携带同一套基因组,但不会把所有基因都打开。胰腺中的β细胞会打开胰岛素相关基因,用来制造和释放激素;B细胞会打开抗体相关基因,用来对抗疾病;皮肤中的某类细胞则可能打开与毛发、色素相关的基因。
被打开的基因组合不同,细胞才分成不同种类。健康细胞与生病细胞不同,不同物种的细胞也各有各的表达模式。近年来,科学家构建了多个单细胞图谱,把数万个基因、数亿个细胞的数据存进数据库,但如何同时理解这些信息成了难题。
奎克表示:“人类大脑不可能做到。而AI模型就是来帮我们做这件事的。”他与团队计划用算法处理复杂数据,相当于给研究者增加了一双“外挂”眼睛。
UCE先建立坐标,能把来自不同实验室、不同组织甚至不同物种的细胞放进同一个抽象数学空间。
奎克形容,这并非物理空间,而是能衡量“相似还是不同”的坐标系。细胞距离越近,关系越近;越远,差异越大。原本零散拼不起来的图谱由此获得统一底图。
“TranscriptFormer”负责“完形填空”。它的训练方式类似ChatGPT,但看的不是文字,而是基因表达值。它反复接触大量缺失部分基因数据的细胞,学习推断空缺内容,逐渐掌握细胞内部基因协同工作的规律。
模型训练数据覆盖12个物种,除人类和酵母外,还包括小鼠、兔子、鸡、斑马鱼、果蝇、非洲爪蛙、致疟寄生虫、海胆、海绵和秀丽隐杆线虫。从单细胞酵母到人类,演化跨度很大。正因数据足够多样,模型才可能学到跨物种通用的细胞“语言”。
这种模型有什么具体用处?研究团队先拿最简单的海绵做例子。
市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。
本文源自:市场资讯
作者:知叙
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.