一家做无人车的公司,为什么需要一万多张GPU?这个问题放在三年前,可能没人能给出答案。但9月17日,九识CTO庄立首次披露了一组数字:公司已建成业内首个L4级万卡集群,算力集群总规模近1.5万卡。九识也因此成为首个建成万卡集群的L4团队。
一周前的9月10日,九识CEO孔旗在广州宣布战略升级为"城市级物理AI"。当时外界看到的只是一个新概念,而万卡集群的披露,才让这次升级有了具体的底座。支撑它的,是一个正在从百亿级迈向千亿级的九识APEX多模态基座大模型。
![]()
万卡集群到底在算什么
万卡集群,指的是由超过一万张加速卡组成的高性能计算系统,用来训练基础大模型。单张AI加速卡像一个高速计算单元,万卡集群则像一座由上万台计算设备组成的"AI超级工厂",能把一个复杂的大模型训练任务拆解后并行处理。
对九识来说,这套算力要解决的是一个很具体的问题:真实城市里的长尾场景。无标识乡村道路、临时施工围挡、异形障碍物、人车无序混行、恶劣天气光影突变——这些路况无法用人工规则穷尽。九识的解法是用大模型去学习物理世界,而万卡集群就是训练这些模型的硬性前提。
据披露,APEX融合了海量真实L4驾驶数据、互联网语言与视频等知识语料,以及真实运营中的人类决策数据。基座训练完成后,向下赋能数据、模型、评测,形成迭代闭环。
车云协同:车端跑日常,云端解难题
基于APEX,九识构建了一套车云协同机制,核心逻辑是:场景越复杂,云端大模型介入越深。
当前主流的车端端到端模型,可以较好覆盖30+km/h的一般道路行驶场景,但存在能力边界。九识的车云联动架构针对不同路况与速度区间分层部署模型:
- 在5-30km/h复杂道路场景,依托车端VLA进行本地实时推理,同时调用云端VLA模型进行理解增强。
- 在0-5km/h末端场景,除车端VLA和云端VLA理解增强模型外,还推出了安全员Agent,能自主完成极端场景下的救援脱困,作出绕行、重新规划路线、靠边停车等高阶决策。
九识和L2的本质区别不在于车速,而在于车端知道自己"不行了"时会主动降速或停车,呼叫云端分析并给出指令,而不是被动等待接管。
一个细节值得注意:九识的VLA并不强制翻译成人类语言再去操控车。它更像人类行动前的"念头"——看到前方有车决定刹车让行,这个"念头"比说出"我要刹车"快得多,也更抽象、更压缩。九识用对齐人类语言的方式,让模型在决策前先思考因果。
2.7亿公里,才是真正的燃料
九识此次战略升级的底气,来自已经跑通的商业化规模。从2023年卖出第一台车,到如今全球车队超过3万台,覆盖20多个国家、300多座城市,累计真实运营里程超过2.7亿公里,三年运力增长100倍。
但这些数字真正的价值,不在于规模本身。2.7亿公里背后,是一个通用大模型公司拿不到的东西:真实物理世界的稀缺数据。每一台车每天在开放城市道路上遇到的交警手势、施工围挡、临时管制、人车混行,都在为APEX提供训练燃料。这些场景无法在实验室里穷举,也无法靠仿真完全复现。
孔旗说过一句话:"复杂城市开放道路能够产生高价值数据,而商业模式本身需要赚钱,才能持续获取数据、推动技术进步。"算力不是成本,是飞轮的起点。
九识成立于2021年8月,创始团队曾在百度硅谷研究院主导Robotaxi、Robotruck的研发工作。创业之初就选择了RoboVan这个新领域,过去五年围绕技术、场景、商业模式三个方向布局:发明了全球第一台Robovan,从聚焦物流到L4技术赋能千行百业,跑出了卖车、服务、运力的商业范式。
万卡算力是硬件工厂,APEX多模态基座大模型是软件大脑,2.7亿公里L4真实运营里程是场景底座。三者形成数据、算力、模型、工程四重自增强壁垒。通用大模型公司没有物理世界的数据,做自动驾驶的公司没有足够规模的真实运营数据——九识同时拥有两者。
从"运货"延伸到"城市治理",无人车正在成为城市管理的能力延伸。这或许才是"城市级物理AI"这个说法背后,真正想讲的事。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.