你敢信吗?人类基因组里藏着的90亿种潜在突变,居然被AI一口气全算完了。以前想搞懂一个致病的基因变异,动辄砸几十万等大半年,现在打开浏览器输个位点,一秒就能出结果。这件直接改变生命科学进程的事,就是谷歌DeepMind刚干成的。
![]()
2003年人类基因组计划花了13年、27亿美元,才把人类30亿个碱基完整读出来。可读出来不等于读得懂啊。总共30亿个A、T、C、G四种碱基,只有2%负责编码蛋白质,剩下98%看着没用,实则管着每个基因什么时候开、开多大强度。绝大多数和疾病有关的变异,恰恰藏在这98%的非编码区里,像锁在黑箱子里,没人能轻易摸透。
这次DeepMind推出的AlphaGenome Atlas,直接把这层黑箱子撬开来了。人类基因组每个碱基位点有3种潜在变异,算下来整整90亿种,人家一个没落下,全给算了一遍。针对每一种突变,它都能给出约27000项预测指标,说清它会怎么影响基因表达、RNA剪接这些关键生命过程。
算下来总共有超过240万亿个预测数值,整个数据库大小足足1PB,体量是当年AlphaFold数据库的30倍。这个体量放以前,别说普通高校实验室,就算是全球顶级研究机构,想自己从头跑一遍都难。普通科研人员想碰一碰,根本没那个条件。
![]()
现在不一样了,这个数据库对全球研究者几乎零门槛。不用自己配运行环境,不用写复杂代码,打开浏览器输入你要查的位点,结果秒出。哪怕是没什么AI基础的生物小实验室,也能直接拿过来用。
之前有个小宝宝,婴儿期就开始频繁癫痫发作,之前做了好多次基因分析都没能确诊病因。Broad研究所的研究人员把患儿所有候选变异输入系统重新排序,排到第一位的,就是9号染色体DNM1基因内含子里的一个G到A的突变。
AlphaGenome直接还原了整个致病过程:这个突变创造出了错误的剪接位点,最终导致蛋白质异常延长,引发了疾病。后续的实验完全验证了AI的预测,这起拖了很久的分子悬案,就这么被成功侦破了。
![]()
还有研究团队用这个数据库分析了5.4万名英国生物样本库参与者的数据,比原来的传统方法多发现了22%的非编码遗传关联。有意思的是,所有拿到这些成果的团队,都没在本地从头跑过一遍模型,全靠直接查现成的表就出了结果。
这可是人类有史以来第一次,全球任何角落的研究人员,只要能上网,就能拿到人类基因组及其变异的完整参考地图。以前读懂一个非编码突变,得有高端GPU资源,得有资深工程师搭复杂分析管线,现在这些技术门槛全被这张图谱抹平了。
现在AlphaGenome Atlas还接入了谷歌智能体平台,研究者不用自己一步步操作,说句话,智能体就能自动查位点、排变异危险度、画结构图,直接给出一套能拿去验证的完整假说链条。
![]()
很多人都记得DeepMind之前的AlphaFold,2020年攻克了困扰学界几十年的蛋白质折叠难题。2022年开放了2亿个蛋白质结构,2023年推出AlphaMissense完成7100万变异打分,2025年AlphaGenome又啃下了非编码区这块硬骨头。
直到这次,AlphaGenome Atlas完成了对人类基因组全部单碱基突变可能性的穷举测绘。短短五年,DeepMind从解析单个蛋白质,一步步跨越到穷尽整个人类基因组的所有潜在突变。从读懂已有的生命结构,到提前预测突变影响,这个进步速度真的超出很多人预期。
![]()
以前找致病突变就像大海捞针,科研人员得自己一点点摸,碰对了才能出成果。现在等于直接给了你一张标注好所有点位的完整地图,捞针直接变成按导航找地址,效率不知道提了多少倍。不管是找罕见病病因,还是开发新的靶向药,整个研究速度都会快好几个档次。
当然也不是说现在所有问题都解决了,AI给出的预测还是需要湿实验验证,没法做到百分百准确。但不可否认的是,这个数据库直接把整个领域的入门门槛拉到了地面,原来只有顶级机构能做的研究,现在普通实验室也能尝试。
![]()
生命科学原本就是靠攒数据、垒基础一步步走过来的,现在有人把最费算力最费时间的前置工作全干完了,摆在所有研究者面前的就是一片开阔的新场地,就等着大家出成果了。不少人都说AI会开启生命科学的新时代,现在看,这个时代其实已经悄悄来了。
参考资料:新华社 谷歌DeepMind发布全基因组突变预测数据库
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.