前两天有人问我,说歪睿,你说视频生成模型算不算世界模型?
我愣了一秒。
这个问题我最近被问过好几次,每次都能感受到提问者的期待,就是那种,如果我点头,大家就可以理直气壮地说,你看,世界模型已经来了,Sora 们就是。
但我真的点不下这个头。
视频看着再真,跟模型懂不懂这个世界,是两码事。
![]()
图1 大语言模型学习语言空间中的统计结构,世界模型还要把感知、状态、动力学、行动与长期结果闭合起来
我花了一整个下午,把一份对比世界模型和大语言模型的材料翻来覆去读了两遍,越读越觉得,这个问题的答案藏在一个特别容易被忽略的地方。
世界模型和大语言模型,解决的根本不是同一道题。
你想想看。
大语言模型在干嘛,它在一个又一个离散的 token 上,预测接下来最可能出现什么。
给它一篇文章的前半段,它补后半段。
给它一句需求,它给你一段代码。
它学的是语言和知识里的统计结构,然后把这份结构压缩进参数里。
世界模型呢,它要学的不是文字,是环境本身。
怎么说呢,它像是一个在你脑子里搭出来的微型物理世界。
给定你现在的观测,再给定一个候选动作,它得回答三件事,世界会怎么演化,哪些结果可能发生,为了目标我该做什么。
![]()
一个是做条件生成,一个是做闭环预测。
一个是符号空间里的文字游戏,一个是状态、行动、时间、因果搅在一起的物理世界。
说实话,这两个东西,从出生的那天起,就不是一道题。
那问题来了。
既然不是一个量级的难度,为什么大语言模型先爆了,世界模型还在实验室里憋大招?
我读完整份材料,发现差距根本不是很多人以为的模型大小,而是五层扎扎实实的地基。
一层一层说。
第一层是数据。
这个最扎心,也最没悬念。
互联网说到底就是人类几千年攒下来的语言训练集。
网页、书籍、代码、对话,这些玩意早就被我们数字化了,可复制、体积小、还自带弱监督信号。
模型要做的只是把它们捡起来,压缩,然后输出。
世界模型需要什么数据?
视频只是最基础的,它还需要时间同步、相机参数、深度、动作、接触、力、速度、目标、结果。
你去看公开的视频数据集,最大的问题就是,画面里那个人伸手拿了杯子,但没有任何标注告诉你,他采取了什么动作。
没有动作变量,模型就只能学到相关性,学不到可干预的动力学。
它知道杯子出现在手里,但它不知道手是怎么伸过去的。
就这一条,卡死了不知道多少团队。。。
那你猜猜,哪个更费钱。
采集成本决定的。
第二层是目标函数。
语言建模有个特别幸福的地方,它的目标干净到令人发指,预测下一个 token。
对就是对,错就是错,训练信号稳定得跟钟表一样。
物理世界呢,下一刻是不唯一的。
同一个画面,人可能往左走,可能往右走,可能干脆停下来。
一个物体可能被拿起来,也可能纹丝不动。你要是只优化像素误差,模型会学成和稀泥,把多种未来平均成一个模糊的鬼影。
你要是优化视觉逼真度,它又可能为了好看牺牲因果一致性。
语言只有一个标准答案的维度,世界有一整个概率空间。
第三层是规模化规律。
文本可以被同一种 tokenizer 切碎,喂进同一种 Transformer 主干,用同一种训练配方,横跨写作、问答、代码。
空间、时间、3D 几何、接触力学、多传感器频率,你试试把这一坨压进一种既高效又无损的表示?
视频的 token 数量本来就大,长时序还要把计算和显存成本成倍往上顶。
我读到这块的时候,真的忍不住想感叹一句,太特么难了。
语言是高速公路,世界是沼泽地。
第四层是评测。
这个特别反直觉,我说出来你可能不信。
大语言模型虽然也有评测污染和主观性,但至少能靠单元测试、标准答案、任务成功率、人工偏好,搭出好几层度量。
世界模型的指标是分裂的。
生成视频清晰度,未来状态预测误差,规划成功率,真实机器人安全性,这四个东西,并不总是正相关。
一个画面更漂亮的模型,可能在接触、遮挡、物体永久性上更不可靠。
像不像,和能不能用,是两回事。
我跟你说,这句话我建议所有做视频生成的朋友贴在工位上。
第五层是系统与商业化。
这个最残酷。
文本生成的边际部署成本低得离谱,失败了就重试,大不了人校对一下。
数字错误便宜,便宜到可以随便犯。
物理系统呢,实时性、功耗、传感器噪声、机械磨损、法规、责任,全是约束。
每个新工厂、新家庭、新道路,都可能带来新的分布偏移。
世界模型的价值,永远被整个系统最弱的一环卡住。
一句话,数字错误可以重试,物理错误要出人命。
所以你看,五层根因摆在这,哪一层都不是参数规模能解决的。
那世界模型是不是就没戏了?
也不是。
世界模型其实已经跨过了展示阶段,只是还没形成通用平台。
我给你挨个说一下,就当聊天。
Google DeepMind 的 Genie 3,现在你给它一段文字,它能生成一个可以实时交互的世界。官方披露的数据是 720p,20 到 24 帧每秒,能在几分钟内保持一致性。
720p,实时交互,几分钟一致。
你敢信,这已经是我见过离游戏最近的生成式模型了。
Meta 的 V-JEPA 2 走的是另一条路,视频自监督预训练,加上动作条件训练,而且展示了在新环境里的零样本机器人规划和控制。
它的思路特别有意思,不在像素层面硬刚,在潜空间里做预测,只预测对行动有用的抽象状态。
NVIDIA 的 Cosmos 就更产业化了,面向 Physical AI,做世界生成、理解、控制和数据管线,覆盖 text/image/video-to-world,摆明了就是给机器人和自动驾驶当数据工厂和仿真器用的。
![]()
这三个放一起看,你会发现一条清晰的线。
说真的,这个节奏比我预想的快多了。
世界模型正在从被动预测视频,走向行动条件预测、实时交互和机器人规划。
它不是落后,它是成果太分散,评测太难统一,离终端用户太远。
大语言模型的能力能直接包装成聊天框,塞进每个人的手机里。
模型的价值藏在仿真、数据生成、规划、机器人控制链路里,你根本看不见它,但它已经在干活了。
这就像什么呢。
我有时候觉得,大语言模型是那种天生适合舞台的演员,一登场就光芒万丈,所有人都看见它了。
世界模型是后台的灯光师和道具师,戏能不能成,一半看它,但观众永远只记得台上的那个人。
那世界模型要怎么追上来?
第一条,先做垂直世界,别一上来就模拟整个现实。
自动驾驶、仓储、工业机械臂、游戏环境,这些地方状态清晰、动作明确、目标固定,能建立高质量闭环数据。
最先产生商业价值的,一定是领域世界模型,它不需要懂所有世界,只要在限定边界内可靠预测就行。
第二条,从像素预测转向任务相关的潜变量预测。
现实里大量细节跟决策无关。高效的路线是只预测对行动有用的抽象状态,物体在哪、哪里可通行、接触关系怎么样、速度多少、风险多大。JEPA 一类的思路就是这个方向。
第三条,大语言模型和世界模型融合,而不是互相取代。
大语言模型擅长把目标翻译成计划、调用工具、解释结果。
世界模型擅长检验计划在环境里到底行不行、安不安全。
未来的智能体一定是双系统,一个负责想做什么、怎么分解,一个负责这样做会发生什么。
第四条,用仿真和真实数据形成飞轮。
高保真仿真生成可控的长尾场景,真实数据用来校准仿真和现实的差距,世界模型再生成新场景去训练策略。
关键不是用仿真替代真实数据,而是把昂贵的真实采集,集中到最有信息量的失败模式上。
聊到这儿,我想起一个更大的事。
为什么大语言模型能先爆发,说到底,是因为人类早就把知识、规则、软件、协作过程,大规模地数字化成了文本和代码。
这是一份几千年攒下来的数字遗产。
模型要做的,只是把这份遗产压缩进参数,再通过一个统一的接口吐出来。
世界模型面对的呢,是一个没有统一 API 的现实世界。
它要处理不可见状态、连续时间、多种未来、行动干预、高风险反馈,还得跟具体的硬件和场景绑在一起。
所以它的瓶颈从来不是模型够不够大。
是数据闭环、因果表示、评测标准、系统工程,这四样能不能同时成熟。
大语言模型让机器更会说话、写作、调用工具。
世界模型要让机器真正学会观察、预测、试演和行动。
前者扩大的是数字生产力。
后者决定的是,AI 能不能真的走进物理世界。
现在回到开头那个问题。
视频生成模型,算不算世界模型?
我的答案还是那句,视频看着再真,跟模型懂不懂这个世界,是两码事。
但如果有一天,那个模型不仅能生成画面,还能在画面里保持物体恒常性、遵守物理约束、响应你的动作、表达多种可能的未来,并且真的去驱动一台机器人干活。
那我就会说。
是,它是。
那一天不会太远。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.