王坚这番话,听着像是在给AI画未来,其实更像是在把行业的遮羞布一把扯下来,大家这几年天天喊大模型,多数时候干的还是同一件事,拿人类已经写好的文字继续复读,再把这个复读机包装成“通用智能”的门票,热闹是热闹,离真正破局还差着十万八千里。
![]()
这事的关键,不在于他又讲了什么高深名词,而在于他点破了一个很扎心的现实,今天的大模型,主要吃的是文本、代码这种人类早就加工过的东西,听上去信息量大,实际上大部分还是人类世界的二手货,真正决定自然科学的那些底层数据,光谱、地震波、基因序列、遥感图像、地层演化记录,压根还没被系统地喂进模型里。
说白了,AI现在最擅长的,不是发现世界,而是整理人类自己写过的笔记。
![]()
这就像一个学生,天天在教辅资料里刷题,背标准答案,做得像模像样,家长一看还以为快成学霸了,可一上真题,碰到没见过的新题型,还是要靠蒙。现在很多大模型就是这个路数,论文、新闻、代码、问答喂得越多,越会说人话,越会写像样的东西,可你要它去理解地球为什么这样裂,为什么那层岩石会有那种信号,为什么某个基因组合会对应某种生物机制,它就开始露怯。
这不是模型不努力,是粮食不对。
![]()
真正的科学数据,才是硬货。文本只是人类对世界的描述,科学数据才是世界自己留下的痕迹。你拿文字去训练模型,本质上是在训练它模仿“人类怎么说”,你把原始物理数据喂进去,才有机会让它学会“世界到底怎么运转”。这差别很大,前者是会聊天,后者才可能会发现东西。
王坚团队拿出来的GeoGPT,就是这套逻辑的样板。它不是那种朋友圈里常见的“加个大模型就叫智能”的玩意儿,而是往地学里扎,往地层演化、时间尺度、空间关系这些最难啃的骨头上啃。把地质时间解析精度从百万年级推到一万年级,这件事表面上像是个科研参数变化,实际上是把“看个大概”往“看清细节”推进了一大步。地球46亿年历史,过去很多判断靠专家经验和碎片数据拼图,现在开始让模型去跑这些关系,背后意味很直接,科研不再只是少数老专家靠多年积累慢慢猜,而是开始进入“海量数据里找规律”的阶段。
这里面最值得警惕的一点,是很多人会把“科学大模型”听成新一轮技术神话,好像又一个风口来了,烧钱、融资、发布会、口号,一套流程走起来,下一批PPT新贵就要排队登场。别急着上头。真正的门槛,根本不在模型名字多唬人,而在数据从哪来,数据怎么标,数据有没有统一格式,数据背后有没有可验证的科学框架。
这才是最硬的地方。
文本数据便宜,几乎现成,互联网公司最熟。科学数据贵得离谱,很多还散落在实验室、观测站、勘探项目、政府系统、行业数据库里,格式乱,标准乱,权限乱,清洗成本高得吓人。你以为是“喂数据给AI”,实际上是先给一堆破铜烂铁做分拣、去噪、对齐、标注,再谈建模。光这一套前置工作,就足够劝退一大半只会喊口号的人。
这也是为什么很多大厂讲AI时,嘴上都在谈未来,手里却都在堆参数。因为参数好讲,显得猛,显得像突破,显得融资故事好听。数据底座不好讲,脏活累活一大堆,短期还看不到炫酷效果,资本不爱听,公关也嫌土。可偏偏真正能决定胜负的,往往就是这种土得掉渣的东西。
大模型行业现在最像什么?像一群人挤在同一条商业街上,门口都挂着“智能”的牌子,店里卖的却差不多,谁都说自己牛,谁都说自己能赋能,最后比的其实是算力采购价、融资能力、流量入口和包装话术。真正能穿出去的,反而不是那几个最会喊的,而是能把数据、场景、科研流程打通的人。因为那不是卖软件,那是在卖行业基础设施。
科学大模型之所以可能成为下一阶段的真东西,就是因为它不像消费级聊天机器人那样,靠“看起来很聪明”就能混过去。科学世界是要验算的,是要复现的,是要被同行拿显微镜挑毛病的。你说地层推断对不对,得有数据;你说基因关联强不强,得有实验;你说新材料有前景,得有测试。这里没有那么多口嗨空间。你模型吹得再响,最后还是要落到“能不能帮助发现新东西”上。
这就把很多互联网式打法直接卡死了。
过去十几年,科技圈最擅长的套路,就是把一个本来很普通的东西,换个包装,再加一层故事,卖出几十倍溢价。手机是这样,电动车是这样,AI也逃不过。先做一个看上去很吓人的入口,再慢慢找理由让用户持续付费。可科学数据这条路,天然不吃这一套。你不能跟地震波谈情绪价值,也不能跟基因序列讲内容生态,最后还是得靠真数据、真模型、真结果说话。
所以王坚讲“AI未来像数学一样成为基础工具”,这句话不是空话,关键在于他其实已经把赛道划出来了。数学为什么能成为基础工具?因为它不属于某一个行业,它是所有学科都离不开的共用语言。科学数据一旦进入基础模型层面,AI就不再只是写字、聊天、做摘要的工具,而会变成一个能跨学科工作的研究助手,今天帮地质学家看层位,明天帮生物学家找蛋白,后天帮材料学家扫配方。听着挺科幻,实际上逻辑很朴素,就是把不同门类里那些原本碎得不成样子的原始信息,统一拉进一个计算框架里。
但别忘了,科学圈和互联网圈最大的区别,就是前者不靠热搜活着。科学不怕慢,怕假。模型不怕小,怕乱。很多公司现在把“科学大模型”四个字挂嘴边,实际上手里根本没有足够的高质量数据,也没有扎实的行业专家体系,更没有长期投入的耐心。它们真正想要的,不是推动科学进步,而是趁着风口赶紧抢个名头,拿去讲资本故事。
这种戏码,科技圈见得太多了。
乐视当年也讲生态,讲得比谁都大,今天看像笑话,可当时照样有一堆人上头。暴风也一样,视频、硬件、VR、概念一个接一个,表面上摊子铺得很大,实际是把有限现金流拆得稀碎,最后只剩下空壳。PPT造车更不用说,车还没见影,估值先上天,讲故事的人一个比一个像天才,等供应链和交付一落地,原形立刻露出来。
这些旧戏和今天的大模型热潮,本质没变。都是先把概念吹大,再靠资本接盘,再找一批用户或者行业客户来试水,最后看谁能把纸面故事变成实际收入。区别只是道具换了。以前是互联网、O2O、共享经济,现在轮到AI。以前吹流量和生态,现在吹参数和智能。词变了,手法没变。
只不过科学大模型这条线,比普通AI应用更难糊弄。因为它面对的是一群更懂门道的人。地学专家不会因为你说“万亿参数”就鼓掌,生物学家不会因为你做了个demo就买单,科研系统看的是能不能省时间、提精度、出新知。这里面的钱,不是那种一把冲上去的快钱,而是长期的、慢热的、重资产的投入。前期没啥好看的,后面才可能形成壁垒。
这也是产业链里最现实的部分。
上游算力厂商当然开心,模型越大,芯片越好卖,云资源越贵,账单越漂亮。中游做平台的,最喜欢拿“行业落地”讲故事,因为这样既能显得自己不是空转,又能把客户拖进长期合作。下游的科研机构和行业单位,嘴上都说要创新,实际上最在意的是钱从哪来,人从哪来,系统怎么接,数据谁来背锅。每一环都不纯粹,每一环都在算账。
消费者呢?这里的“消费者”其实是科研人员、企业研发部门、政府项目方,他们的心理也很典型。都想要更快出结果,都怕被同行甩开,都希望自己手里有个新工具能领先一步。于是只要看到一个“AI+科学”的故事,天然就会多看两眼。这个心理没毛病,问题是骗子最爱利用这种焦虑。你越怕落后,越容易被一句“下一代范式”拿捏。
所以科学大模型真正的考验,不是发布会那天有没有掌声,而是两年后还能不能继续跑,五年后有没有稳定产出,十年后是不是成了行业标准。如果只是又一轮包装过的概念,那热度过去就没了,连响声都不会太大。可如果真把科学数据、行业知识、基础模型做成了可复用的底座,那就不是一门生意了,那是重新定义很多研究方式。
这话说得重一点,但其实很直接。
别把今天这场AI热潮看成全都在奔向同一个终点,很多人只是想借着AI把旧生意重新卖一遍,换个壳,换个词,继续收钱。真正值得盯的,不是谁发了多大的模型,而是谁能把最难的原始数据啃下来,谁能把看不见的科研流程接进去,谁能在一地鸡毛里做出可验证的结果。
发布会上的热闹,从来不值钱。
值钱的是那些没人爱讲、但谁都绕不开的脏活累活。科学数据就是这种东西,没它,AI再会说,也只是个高级复读机,有它,AI才有可能从嘴上厉害,变成真能干活。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.