![]()
大模型的虚火还在烧。
新眸原创·作者 | 桑明强
不久前,字节跳动创始人张一鸣与Seed负责人吴永辉共同召开了一场Seed全员会,除了给团队打气,会上他还谈到了对模型蒸馏的看法:不要把蒸馏当作提升模型能力的捷径,哪怕这意味着可能会落后于国内同行。
很多人只看到了不走捷径的字节,反而忽略了它背后的战略定力。
举个例子,SP时代比短信订阅数,团购时代比覆盖城市数,O2O比地推铁军,短视频比日活。每一次大家都在比那个最容易量化、最容易写进PR稿、最容易让投资人兴奋的数字。每一次都有人在那个数字上跑到第一,然后呢?
历史的经验告诉我们,真正活下来的,从来不是数字最好看的那个。
今天的AI行业,正在把这场数字游戏玩到极致。
比参数,从百亿到万亿;比榜单,MMLU、GSM8K、HumanEval、Arena Elo一个接一个;比单项能力,谁的视频生成手指更正常,谁的代码通过率高几个点,谁的多模态又在某个benchmark刷新纪录。KOL加班做对比视频,结论永远是"国产又赢了"。朋友圈一片欢腾,仿佛AGI下周就来。
可你把目光从这些数字上移开,去问真在生产环境用AI的人,得到的多半是另一种答案。
模型在榜单上无所不能,到了具体工作里,更像个聪明但不靠谱的实习生,什么都能聊两句,真交给他一件完整的事,你还得在后面收拾烂摊子。
这就是我们今天面对的局面:参数越来越大,榜单越来越好看,热闹越来越多,可AI和真实世界之间那道沟,非但没填上,反而越变越宽。
01
榜单上的胜利与现实中的困境
今年7月,月之暗面发布Kimi K3,参数精确到2.78万亿,全球最大开源模型。那天我的朋友圈被刷了屏。结果三天后的晚上,月之暗面发公告,说"用户请求量大幅超出预估,逼近现有集群承载极限",即日起暂停C端新用户订阅。
这件事本身就能说明一些问题。花这么多钱,烧这么多卡,训练出参数上碾压同行的模型,结果连最基本的用户访问都扛不住。这就像车厂造出台发动机参数全球第一的跑车,一开出来发现油箱只能装十公里的油。
另外,榜单本身的可信度也越来越可疑。今年八月,两家机构发布同月份国内AI应用月活数据,同一个豆包,一家5.28亿,另一家3.82亿,差了1.46亿。没有谁造假,只是月活这个用了二十年的指标,到了AI产品这儿突然测不准了。插件调用算不算?API访问算不算?连统计口径都没有共识,那些煞有介事的排名,看看就好。
视频生成领域的榜单竞赛,已经到了走火入魔的地步。可灵、即梦、Vidu这些,每过一端时间就有一家宣布在某个评测集登顶,KOL迅速跟进出"深度评测",结论永远是"国产又赢了"。
可你去问真正用这些工具做内容的人,他们关心的根本不是谁在benchmark上高零点几分。他们关心生成一条视频要等多久,改十次能不能有一次能用,复杂场景人物会不会崩,商用版权有没有保障。
这些问题,没有一个榜单能回答。
我想起2011年的千团大战。全国五千多家团购网站,开发布会都在说用户数、覆盖城市、单日交易额,数字一个比一个吓人。王兴那时候就讲,团购的核心不是铺多少城市,是每个城市能不能把单位经济模型跑正。没人听。大家都烧钱抢市场,烧到最后,活下来的是美团。
今天AI行业的逻辑很类似。
大家都在拼那些容易量化、容易传播、容易写进PR稿的数字,很少有人愿意碰真正难的事:怎么让模型在工业现场稳定工作,怎么让AI在零容错的金融医疗场景给出可解释、可审计的结论,怎么把推理成本降到企业愿意大规模买单的程度。
这些事不性感,上不了热搜,也没法在发布会上用一张PPT展示,但它们才是AI真正进入生产体系的门槛。
苹果就是最好的例子。2024年WWDC上Apple Intelligence被吹得天花乱坠,结果跳票两年,今年WWDC才拿出像样的版本,核心能力还得靠接OpenAI和谷歌的API。发布会当天,苹果股价从盘中317美元跌到收盘301美元,市值蒸发2300亿美元。华尔街逻辑很简单:你演示的这些,ChatGPT两年前就有了,我们等了两年,就等来了这个?
这就是参数繁荣掩盖下的真相:我们在实验室里、在评测集上、在精心准备的demo里取得的所有胜利,到了真实世界都要重新打一遍折,而且这个折扣,经常大到让你怀疑人生。
02
抄作业抄不出第一名
张一鸣为什么对蒸馏这么敏感?
技术上的蒸馏本来是正经方向,用大模型输出训练小模型,让小模型在特定场景接近大模型能力,同时降低推理成本。但在今天的国内AI圈,蒸馏已经异化成了一条抄近路的产业链。
坦白地说,新模型发布流程现在高度标准化。国外发布或者更新一个新模型,最多几周时间,国内就有一堆模型宣布"在各项基准上追平甚至超越"。怎么做到的?说白了很简单:拿新模型的输出当训练数据,蒸馏到自己的模型里,再针对benchmark做专门优化。
OpenRouter有个数据很说明问题。今年1月,开源模型处理的token占比是34%,到了6月变成65%。半年翻了近一倍。开源模型突飞猛进的背后,有多少是真正的技术突破,有多少是蒸馏和benchmark过拟合带来的虚假繁荣?关于这个问题,很多人自己心里都有数。
今年7月,前OpenAI研究员Diogo Almeida发了篇博客,说当年那篇奠定Scaling Law的论文,从根上就有个bug,计算推理最优分配时算错了,导致整个行业过去五年都在训练"参数过大、训练不足"的模型。DeepMind的Sander Dieleman第一时间转发,说这个bug大概率让行业在错误方向浪费了巨额算力。
这件事最耐人寻味的是,这么多聪明人,这么多顶级公司,几年时间,上万张GPU烧进去,居然没人发现这个基础错误。为什么?
因为所有人都在同一条赛道上狂奔,没人停下来问问路对不对。大家都在堆参数,你不堆你就落后;大家都在刷榜单,你不刷你就融不到钱。路径依赖一旦形成,连质疑的声音都会被淹没。
蒸馏就是这条路径依赖的终极形态。
可问题是,抄作业永远抄不出第一名。如张一鸣所讲,你蒸馏Claude,最多无限接近它。更要命的是,这种路径依赖会从根上废掉一个团队的研究能力。当你的工程师习惯了用别人的输出训练模型,他们就再也不会去想,怎么从第一性原理出发改进模型结构,怎么构建真正高质量的数据集,怎么解决那些根本性的技术难题。
这才是张一鸣真正担心的。他看到的不是一时的榜单高低,是整个团队的创新文化会不会被捷径腐蚀。
Builder.ai破产就是很典型的例子。这家估值15亿美元的英国公司,拿了微软和卡塔尔投资局4.5亿美元,对外宣传AI可以自动写代码,客户想要什么软件几分钟就能生成。今年五月破产清算时大家才发现,所谓AI自动生成,后台是七百多个印度程序员在一行行手写代码。最讽刺的是,这家公司还上过福布斯"改变世界的50家AI公司"榜单。
这样的故事不是个例。从Humane AI Pin到Rabbit R1,过去两年倒下的AI公司已经数不清。有机构统计,2024到2026年入场的AI公司,40%已经关停,原因惊人地一致:没有核心技术,没有数据壁垒,没有真正的场景,大模型一旦更新了同样的功能,它们的存在价值立刻归零。
历史不会重复,但总是押着同样的韵脚。今天AI行业的参数竞赛、榜单崇拜、蒸馏捷径,和当年的手机参数大战、新能源PPT造车,本质上是同一件事:用容易量化的数字,回避真实场景里的艰难跋涉。
03
离开排行榜之后
什么才是真正的繁荣
当然不是说参数不重要,也不是说榜单毫无价值。技术发展早期,量化指标确实能帮我们看清进步的轨迹。但当整个行业把手段当成目的,把指标当成目标,事情就开始变味了。
移动互联网那十年的繁荣,不是因为手机芯片从单核跑到了八核,是因为iPhone重新定义了智能手机,是微信、支付宝、美团、滴滴这些产品,真正改变了十几亿人吃饭、出行、社交、付钱的方式。特斯拉带动的新能源革命,也不是因为电池能量密度每年提升几个百分点,是它证明了电动车可以比燃油车更好开、更智能、更便宜,把整个产业链带了起来。
这些繁荣背后当然有技术参数的进步,但参数是结果,不是原因。真正驱动繁荣的,是技术和真实需求的深度结合,是产品在具体场景里创造的真实价值。
今天AI行业的问题,恰恰在于太多人把参数当成了原因。
他们觉得只要模型足够大,一切问题都会迎刃而解;只要榜单分数足够高,商业化自然会来。可现实是,GPT-4到GPT-5,参数翻了几倍,能力强了不少,但真正愿意为AI付费的个人用户并没有几何倍数增长。很多企业买了大模型API,用了几个月就发现,除了写文案做总结,好像也找不到更多真正能落地的场景。
麦肯锡有个报告(《The State of AI in 2025》),2025年企业在AI上的投入比前一年翻了一番,但真正把AI部署到核心生产流程的比例,只从12%涨到了16%。剩下的84%,要么还在做POC,要么用了几次就扔在那儿了。钱花了,热闹看了,最后发现AI并没有像预期那样重构业务流程。
为什么会这样?因为真实世界太复杂了。
你在实验室里训练模型,用的是干净的、标注好的数据。可到了工业现场,传感器数据是有噪声的,生产环境是动态变化的,很多关键参数根本没法直接测量——催化剂的活性、热态工件的变形量、化学反应的中间状态,这些东西你连数据都采不到,模型再大,有什么用?
你在评测集上做数学题正确率99%,可到了金融风控,一个错误判断可能就是几千万损失;到了医疗诊断,一个幻觉可能就是重大事故。这些场景要求的不是99%的正确率,是六个九、七个九的可靠性,是每一个决策都可解释、可追溯、可审计。
这也是为什么真正在产业里深耕的人,对那些天花乱坠的模型发布越来越淡定。
好消息是,已经有人开始往这个方向走了。
微软今年财报会上,纳德拉讲的重点已经不是Copilot又加了多少参数,是财富500强里有多少家在用Azure的AI平台,是Copilot Studio里企业自己搭建的Agent数量,是商业模式从席位订阅转向"席位+按量计费"。谷歌在Gemini at Work上展示的,也不是什么炫酷demo,是大众、华纳兄弟、Snap这些公司怎么把Gemini真正嵌到生产流程里。国内的腾讯WorkBuddy、阿里QoderWork、字节TRAE、金山WPS AI,也都在做同样的事——不再比谁的模型更聪明,开始比谁能更深度地嵌入工作流,谁能真正帮用户解决问题。
当然,这条路注定更难走。它要求你沉到行业里去,理解客户的真实痛点,和客户一起打磨产品,忍受很长时间没有高光时刻的寂寞。它不像发布一个万亿参数模型那样能上头条,不像刷到榜单第一那样能让投资人兴奋,也不像KOL的评测视频那样能带来潮水般的流量。
但这才是真正的AI浪潮该有的样子。
本文系新眸原创,申请转载授权、商务合作请联系微信:ycj841642330,添加好友请备注公司和职位。
更多内容,点击下方关注
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.