![]()
“AI教母”、斯坦福大学教授李飞飞再度谈空间智能和人形机器人了。
智能纪元AGI 7月29日消息,今晨a16z(最会搞博客的投资机构)发布了一个42分钟的专访李飞飞团队的视频。
按照平时1小时a16z播客专访推算,这条视频可能剪掉很多李飞飞回答的部分内容。
主持人是a16z合伙人Martin Casado,嘉宾分别是World Labs创始人兼CEO,斯坦福大学教授李飞飞(Fei-Fei Li),SceniX联合创始人、哥伦比亚大学助理教授李昀烛。
一个背景是,七天前的7月22日,李飞飞宣布,World Labs正式收购顶级机器人仿真初创公司SceniX。两大顶尖研发团队联手,标志着具身智能的技术竞争正从“纯语言模型”全面走向“物理世界模型”。
三家机构的关系是这样的。
SceniX是a16z被投项目当中最重要的项目之一, 主要还是a16z投资的物理AI赛道项目不太多。
李昀烛是李飞飞的博士后学生, SceniX也 注册成为World Labs的Marble模型客户。
之前,李飞飞甚至不知道这是谁的公司,后来才发现是自己博士后学生的公司。师生意外重逢,最终合并。
李飞飞认为, SceniX 团队正在做的事情是试图解决机器人领域这个极其困难的问题——数据的缺乏。训练数据的缺乏、评估数据的缺乏,而这 可以解决 World Labs模型在真实世界数据的挑战。
因此,李飞飞团队收购 SceniX后, a16z攒了这么一个局,想聊聊物理AI和收购后的变化。
今年2月, 李飞飞创立的空间智能与世界模型企业 World Labs宣布完成10亿美元的新一轮融资,投资方包括英伟达、AMD、欧特克(Autodesk)等巨头,最新估值已达到 约 50亿美元(约合人民币350亿元)。
而World Labs第一个客户就是Autodesk。
在我看来,李飞飞在这个对话当中还是有很多爆点金句,值得深入研究。智能纪元AGI专门摘录了李飞飞的对话全文,帮助大家划重点,更好理解李飞飞的公司到底要做什么。
1、谈空间智能是AI的下一个前沿
World Labs是一家成立两年的前沿模型实验室。我们正在构建AI的下一个前沿领域,也就是我们所说的空间智能 ( Spatial Intelligence ) 。
空间智能是指让 AI具备生成、理解、推理以及与物理或虚拟空间进行交互的能力。 实现空间智能的重要途径是构建大型世界模型 ,这正是 World Labs的核心业务。
首先,在空间中行动或交互不仅仅需要机器人。看看创意领域——无论是VFX、游戏还是设计——很多用例中,你可以在虚拟空间中创造和行动。
World Labs的论点一直是:我们生活的世界可以是多元宇宙,我们创造技术让人们、建造者、开发者能够在不同的空间中行动。
话虽如此,在物理空间中行动的能力是未来AI世界最令人兴奋、最重要的能力之一。而机器人正是这一能力的重要载体。
World Labs始终认为机器人是空间智能和世界模型极其重要的应用场景。因此,邀请Scenix团队加入World Labs是实现我们长期愿景和使命的一部分,这也是我们一直致力于达成的方向。
Scenix正在开发“真实到模拟再到真实”(Real-to-Sim-to-Real)的流水线,可以用数字世界中可以大规模生成的数据,来替代真实环境中需要的所有数据和评估。
想想人类智能。我们在大脑中做了大量的模拟。为什么?因为模拟扮演着一个非常重要的角色,这是真实世界数据无法提供的,那就是反事实推理。我们正在构建的是一个一致的世界——在空间上、时间上、不同视角上、以及不同类型的交互上都保持一致性。
说一个有趣的故事。你可能以为因为我们合作过,我们一直在讨论Scenix和World Labs的整合。但事实并非如此。他们是作为客户进入World Labs的。
当我们去年冬天发布第一个生成式基础模型Marble时,Scenix就注册成为了客户。
我甚至不知道那是谁的公司,我给李昀烛打去电话,惊讶地发现这是他的创业项目,随后我们意识到双方之间存在巨大的协同效应。
当年,李昀烛在斯坦福做博士后时就已经拿到了教职,虽然我希望他能多留几年,但他得去开启真正的教职生涯,他是一位从建模到硬件的全栈机器人研究者,他和Changi在Scenix带出的学生团队,正是World Labs此前所稀缺的人才库。其次,Changi团队拥有惊人的仿真能力,他是资深的仿真领域研究员与专家,而World Labs的工作在很大程度上需要接入仿真世界。
2、数据是挑战,生成式 3D 与仿真技术需要结合
Marble是World Labs一直在训练和迭代的基础模型的代号。Marble目前公开发布的基本能力是:
接收一个提示——可以是图像、几张图像或文本——将其转化为一个几何一致的世界,可以用3D几何表示,无论是高斯溅射还是网格。
Scenix团队正在做的事情是试图解决机器人领域这个极其困难的问题——数据的缺乏。训练数据的缺乏、评估数据的缺乏。
这与语言模型完全不同,后者的数据在互联网上是丰富的。
我们知道,为了让机器人工作,我们必须释放缩放定律的力量。但这从何而来?这是机器人领域每个人都在与之斗争的深刻问题。
World Labs正在构建全模态基础模型(Omni-Models)。
随着技术的发展,一些最令人兴奋的基础模型是全模态模型——它们接受多模态输入,产生多模态输出。机器人基础模型会是什么样的?它很可能涉及动作,很可能涉及世界状态之外的动作输出。我们绝对不会排除这种可能性。
因此,我们和Scenix进行合并。主要因为两家公司的业务具有极强的互补性,并且拥有共同的使命。
李昀烛是三位技术联合创始人之一,另外两位创始人分别是哥伦比亚大学教授Changi Zhang,他是仿真领域的顶级技术专家,曾在维塔数码和腾讯工作过,具备视觉特效背景和创业经验。
另一位是Sunonni,他是一位优秀的工程主管,此前曾在一家被亚马逊收购的初创公司工作,在亚马逊期间积累了丰富的计算机视觉技术栈经验。
因此,当两家公司开始深度探讨时,我意识到Scenix在人才储备上对World Labs形成了绝佳补充,尤其他们具备从建模到硬件的全栈机器人能力。
我非常欣赏Scenix的一点,现在确实有很多机器人公司在做模型,但李昀烛和他的联合创始人对待机器人的态度极其务实。
尽管李昀烛和Changi来自学术界,但他们的第一直觉就是与真实产业中的设计伙伴和客户紧密合作,无论是工业实验室、仓库,还是电子元器件装配线。这种切入机器人的方式非常令人耳目一新,这也让我对与他们的合作感到无比兴奋。
我希望现实世界能够运作。我们生活的世界可以是多元宇宙,我们创造技术让人们、建造者、开发者能够在不同的空间中行动。
事实上,Sergey Levine说过,模拟最终总会偏离物理世界,真实世界数据收集绝对关键。你怎么看这种方法的可行性?
我认为,这不是模拟或不模拟的二选一。所有这些共同作用才能让机器人工作。
想想人类智能。我们在大脑中做了大量的模拟。为什么?因为模拟扮演着一个非常重要的角色,这是真实世界数据无法提供的——反事实推理。
你演绎出还没有发生、不可能发生、或者你没有足够数据让它在真实世界中发生的事件。当你演绎它时,你学会了如何在其中行动。
人类一直在这样做。我知道你去看了世界杯。我敢肯定,在每场比赛的计划中都有模拟——无论是数字的还是白板上的。
模拟扮演的角色就是反事实推理。这在机器人领域非常重要,因为我们不可能拥有足够的真实世界数据。
一个真实的例子:自动驾驶行业。
Waymo已经正式表示他们使用了数十亿小时的模拟。实际上,Waymo的模拟比重更大,而不仅仅是依赖真实世界数据。汽车是最简单的机器人——2D的。所以显然,模拟在机器人学习中扮演着巨大角色。
仿真中, 主要有两个核心应用场景,分别围绕 评估 (Evals) 与 训练(Training) 展开。
比如,在训练方面的可控性,你希望精准掌控状态、参数、光照、摩擦力、物理参数乃至物体的几何形态和种类等所有可能的变化,确保覆盖各种复杂场景,从而生成信息量丰富的数据,提升机器人的鲁棒性。
如果仅在现实环境中操作,这会极其困难。
采用遥操采集数据的速度很慢,而且会受限于机器人的数量和遥操作设备的数量,整个数据运维面临着诸多挑战。
但在仿真环境中,一切皆可控、皆可系统化配置,你可以明确清楚地掌控自己覆盖了哪些数据分布,从而建立起机器人能在该分布下稳定工作的信心。这种信心、效率与可扩展性,正是客户选择使用我们的数字世界来训练机器人系统的价值所在。
极具戏剧性的是,甚至在 Scenix和我深入探讨合作之前,Marble的各类意向客户就已经提出了这类需求,只是当时我们尚无精力去服务他们。那时我们接到了很多早期机器人公司的电话,从开发底层模型的团队到专注于下游务实场景的团队都有,我们真切看到了这种强烈的市场需求。
3、人形机器人不一定是物理AI的最优解
人形机器人模仿人类身体,但进化已经为非结构化环境优化了人类身体。
因此,我们的手指和双腿并不是专门为了做某单一任务而生的最佳工具。
比如,如果我们这个物种唯一的生存目标就是爬树,我们就不一定会演化成现在的身体结构,可能会长出截然不同的手指。但人类最终演化出的这种体态极其通用,却未必在每件事上都是最优解,而这正是为了在非结构化环境中生存。
然而,从商业和务实的技术视角来看,这种非结构化环境和通用身体实际上是最难解决的问题,甚至未必是解决问题的正确途径。更合理的做法是专业化分工,用更专业的身体来解决更窄的问题。
但Scenix面临的挑战在于,其基础设施需要具备形态无关性,从而能够服务不同的机器人躯体和不同的半结构化环境。
在当下的AI领域,最难的就是保持恰到好处的理性乐观。即便是大语言模型也没能达到人类大脑的能效,人类大脑运转只需要30瓦的功率。所以我们离那个目标还差得很远。
对于人类能效比的机器人,我认为这需要很长时间。如果你真的考虑真实环境中的机器人,最终它永远是一个系统。每个在真实环境中工作的机器人都是一个系统工程——硬件、软件、大脑,甚至到你的手指的摩擦系数这样的细节。有很多事情你必须考虑,才能让这些成为现实,这需要迭代。
但让我兴奋的是,我一直处于机器人学习的最前沿,试图推动最前沿。但最前沿的发展总是比我预期的要快。所以我现在关注和试图研究的东西,与我开始博士时完全不同。这说明了整个生态系统发展的速度有多快。
我们必须校准我们的预测。我们会看到很多进展,但要达到人类水平的效率和能力,需要更长时间。
4、我们不会直接一股脑整合,而是先服务好商业化客户
对于整合,目前,我们会深思熟虑地推进。我们不会急于整合所有代码库和团队,因为 Scenix 有非常完善的、相当独立的技术栈、客户和产品。我们会花时间。
我们已经在模拟方面以及潜在的基础模型、动作条件模型方面开始对话。而且他们也在作为内部客户使用Marble。所以我们会有整合,但我们不会急于把团队混成一个“完整的沙拉碗”。
李昀烛会搬过来。World Labs正式成为了一家跨东西海岸的公司,总部设在旧金山。
我住在帕洛阿托(Palo Alto),感觉就像在另一个州一样。但我们将在纽约设立办公室,这有助于我们吸引东海岸的顶尖人才。
此外,我们规划在两地办公室都配置机器人设备,以便测试和完善工程技术栈,实现远程操作和调试机器人。
下一步,我们与Scenix团队一同几个重要的垂直应用场景中验证标杆客户,证明我们的系统和基础设施能切实解决他们的自动化需求,并且这些客户成为我们扩大业务规模的行业案例,我们就会感到非常满意。
我们随时准备开展业务合作 。欢迎所有人联系我们,非常期待了解大家的具体应用场景。
©本文为原创内容
未经授权,禁止转载
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.