82亿美元,全股票形式。AMD把一家成立仅两年的世界模型公司World Labs收入囊中。
收购公告里,AMD给出的理由是:“World Labs 的模型经验,将帮助AMD更深入地理解工作负载如何演变,进而塑造未来的技术路线图。”
![]()
这句话的落点不在模型本身,而在“工作负载如何演变”。一家芯片公司愿意为一家模型公司开出这个价格,看中的是提前判断算力需求往哪走的能力。
一个词,两种出身
世界模型这个词,最早不是计算机科学提出来的。1943年,英国心理学家Kenneth Craik在《The Nature of Explanation(解释的本质)》里写到:人的大脑会在内部建立一个关于外部的“小规模世界模型”,并利用这个模型预测未来可能发生的事情、比较不同的行动方案。
2018年,Google Brain的David Ha与人工智能先驱Jürgen Schmidhuber共同发表论文《World Models》,正式在人工智能领域提出这一概念,并给出一个框架:世界模型=观察世界(V)+预测世界(M)+在内部世界中学习行动(C)。
这条线索指向的问题一直没变:AI需要的可能不只是生成内容,而是形成一个关于世界如何运转的内部模型。
李飞飞和杨立昆,分歧在哪
今年6月,李飞飞发表长文,认为世界模型是当今AI最重要、也最被过度使用的术语之一。她按功能把世界模型分成三类:
- 渲染器:输出观测,以人眼观看的像素形式呈现,文生视频是代表产品;
- 规划器:回答智能体下一步该做什么,还处于萌芽状态;
- 模拟器:负责输出世界状态,是连接二者的桥梁,最重要也最容易被忽视。
李飞飞认为,模拟器提供的是世界模型的结构骨架,既能从中导出视觉外观供渲染器使用,也能从中导出行动后果供规划器使用。
杨立昆的看法不同。他认为生成视频不等同于理解世界,你根本不可能预测视频里发生的一切,合理的可能情况有无穷多种。他给出的方案是联合嵌入预测架构(JEPA)。
杨立昆对JEPA的解释是:为了能够做预测,你需要找到一种抽象。在他看来,世界模型不应该是模拟器,它们应该在抽象空间中工作;世界模型不应该是生成式模型,也不应该是视频生成系统。
两条路线最终指向相似的问题——AI能否形成对现实世界的认识,并据此预测环境如何变化、行动会产生什么后果。
巨头的取舍
世界模型不是新概念,但新一轮产业热度大约从2024年前后开始,并在2025年至2026年随着视频生成、机器人和Physical AI的快速发展进一步升温。
2025年11月,Meta首席AI科学家杨立昆宣布离职。他在接受采访时表示,2024年前后,Meta逐渐将更多资源转向大语言模型和超级智能方向,FAIR等偏探索性的研究因此受到影响。在他离开之前,Meta已经削减了包括FAIR团队成员在内的部分AI岗位。
离开Meta后,杨立昆个人成立了新公司AMI Labs,延续JEPA方向的探索。他曾多次表示大语言模型不是通往人类级别、类人智能的正确技术路径。今年9月,在纽约的演讲中,杨立昆重申:“如果你关心人类水平的AI,就不要研究LLM。”他把这句话用红色字体放在结尾的PPT中。
李飞飞也把世界模型视为通往更高级机器智能的重要技术路径。她曾在社交平台表示:大语言模型仍然是黑暗中的文字匠人:能言善辩,却缺乏经验;知识渊博,却脱离现实。
但大语言模型仍是当下科技巨头押注的重点。世界模型仍处于技术探索期,商业化路径远未成熟。杨立昆离职Meta、创立AMI Labs,是这种资源取舍的一个结果。
谷歌在世界模型方向倾注了更多资源。2025年8月,Google DeepMind发布Genie 3,DeepMind表示:“Genie 3是我们突破性的世界模型,可以通过单个文本提示词创建交互式、可玩的环境。从照片般逼真的风景到奇幻的境界,可能性无穷无尽。”
芯片公司的动作更早。2016年,黄仁勋亲自向OpenAI交付了第一台DGX-1 AI超级计算机;英伟达在2025年1月发布了Cosmos世界基础模型平台。现在,AMD收购了一家世界模型公司。
从生成镜头,到生成一个世界
AMD宣布收购World Labs的同时,李飞飞发长文回顾了一路走来的历程。她写道:宇宙并非由文字构成,而是由真实存在的事物组成。从科学、娱乐到机器人,人工智能需要解决的诸多重要问题,都需要模型来推理物理世界的结构和行为。
她重点提到近期发布的Atlas。李飞飞称,Atlas解决的是空间智能领域一个长期存在的关键问题:如何仅凭少量2D图像,重建真实空间,并预测此前没有观察到的新视角。它能够用于机器人、娱乐场景生成、房地产、设计、建造等领域。
机器人是这套能力最直接的去处。当下的机器人泛化程度仍然有限,往往只能做一些固定的动作,在面对突发场景时经常失灵,这正是世界模型所努力解决的问题之一。
内容产业是另一个方向。World Labs联合创始人Ben Mildenhall曾表示,World Labs一直拥有不少来自创意行业的用户,他们使用相关模型维持2D图像、电影、3D和游戏之间的空间一致性。
谷歌Genie 3最大的变化之一,是从“生成一段视频”走向“生成一个可以实时进入的世界”:它可以根据文字提示生成动态环境,以24fps运行,维持数分钟的世界一致性。
如果说文生视频是在“生成一个镜头”,那么Genie 3开始尝试的是“生成一个可以进入、互动的世界”。未来的内容生产对象,可能不再只是“一部电影”“一集电视剧”或者“一条短视频”,而可能变成一个可以持续运行、不断变化、允许用户进入的数字世界。
不久前,彭博社报道称,字节跳动正在基于Seedance开发实时空间视频生成模型。该项目涉及跨部门及算力资源协调,目标并不只是一段生成好的视频,而是一个能够根据用户声音和动作实时变化的虚拟环境,潜在应用包括直播、短剧和游戏,并计划服务Pico头显。
AMD的82亿美元,买的是这家公司今天的模型能力,也是世界模型这类前沿模型可能给芯片硬件研发带来的前瞻性。当模型开始生成可以进入的世界,算力需求会变成什么样,芯片公司想比其他人先知道答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.