![]()
©潮涌AI编辑部
2024年12月,上海张江,一家新公司注册成立。
硕博占比超过九成,CEO是朱兴,首席科学家沈宇军来自蚂蚁技术研究院交互智能实验室。
这家公司叫蚂蚁灵波,蚂蚁集团全资子公司,注册资本1亿元,在刚刚结束的WAIC上以“镇馆之宝”的名号扩散势能。
毫无疑问,蚂蚁集团内部多了一支被员工称为“物理AI特工队”的队伍。他们的任务不是做支付,不是做大模型聊天机器人,而是给实体机器人造“大脑”。
蚂蚁如何爬出一家“机器人公司”
朱兴2011年加入阿里巴巴。
过去14年里,他做过支付、金融服务、O2O,2023年刚刚完成支付宝广告商业化的从0到1,而在2024年底,他被抽调筹建蚂蚁灵波。
这是一个令外界意外的选择。
从时间线来看,灵波的筹建时间非常紧迫。
朱兴没有机器人行业的背景,但他有一个蚂蚁当下最需要的能力:把技术变成能落地的产品。
灵波的首席科学家沈宇军则来自蚂蚁技术研究院交互智能实验室,研究方向是计算机视觉和深度学习,本科毕业于清华大学电子工程系,然后选择在香港中文大学信息工程系攻读博士学位,曾在商汤实习,担任过字节跳动高级研究员。
![]()
两人搭配的逻辑清晰:一个懂产品化和商业化,一个懂技术底层。
目前,灵波团队硕博技术人才占比超过九成。在蚂蚁集团内部,灵波挂在CTO线下,与百灵大模型团队、支付宝AI团队平行,但专攻“物理智能”——也就是具身智能。
蚂蚁集团对灵波的战略定位,是把AGI目标拆成两个层面:数字智能和物理智能。数字智能由百灵大模型、AI支付宝、蚂蚁阿福等业务承载;物理智能的核心执行主体,就是灵波。
六款模型,两条路线
2026年7月初,蚂蚁灵波在一周内连续发布六款具身智能大模型,覆盖视觉、视频、空间感知、灵巧操作、世界模型和世界动作模型六个方向,并且全部开源。
这不是一次普通的产品发布,灵波在发布会上展示了它的技术路线选择:双线并进。
第一条是VLA路线(视觉-语言-动作),代表模型是LingBot-VLA 2.0。这条路线的主流逻辑是“看到→理解→动作”,基于视觉-语言模型做基座,让机器人根据视觉输入和语言指令输出动作。这是当前行业最主流的技术路线,Figure、Google DeepMind的RT系列都在这个方向。
第二条是世界模型路线,代表模型是LingBot-VA 2.0。这条路线不直接映射感知到动作,而是先预测“世界接下来会如何变化”,再同步生成下一步动作。沈宇军在技术分享中把VA 2.0定义为“行业首个具身原生世界动作模型”,基于自回归架构从零开始预训练,实现了单卡150Hz的实时推理。
六款模型的分工是清晰的:
![]()
VA 2.0的技术细节值得单独拆解。
据灵波发布的技术文档,它采用了四项核心设计:语义视觉-动作分词器、严格的因果预训练范式、MoE架构,以及增强的异步推理机制。前三项解决的是“理解世界”的问题,最后一项解决的是“实时响应”的问题,让机器人在执行当前动作时,模型已经开始预测未来状态。
150Hz的推理频率是什么概念?
它意味着模型每秒完成150次推理,单次响应约6.7毫秒;作为参照,人类眨眼一次约需300-400毫秒,也就是说,机器人“思考”一次的时间不到眨眼时间的1/50。
灵波的技术文档称,VA 2.0让机器人具备了“边推演、边行动”的通用控制能力。
但一位机器人行业从业者向亿邦动力表示,推理频率只是工程指标之一,真正的考验是在真实场景中的泛化能力。“在仿真环境里跑150Hz和在有老人、小孩、宠物的家庭环境里跑150Hz,是两回事。”
开源、R1和生态
灵波这次发布的另一个关键策略是全栈开源——权重、代码、后训练工具链、评测集全部放出。
在技术标准尚未定型的阶段,开源是建立生态影响力的最快方式。灵波的模型支持多种机器人构型,不同本体和场景均可接入同一套“大脑”。
目前,已有十几家机器人厂商与灵波建立合作。
除了蚂蚁直接参与投资的宇树科技、星海图,今年6月,乐聚机器人官宣旗下KUAVO 4 Pro(夸父)已完成LingBot-VLA的后训练适配,并围绕GM-100评测体系里的95个真实操作场景做了系统性测评。
![]()
LingBot‑VLA 2.0训练
但灵波并非只做“大脑”。
2025年9月,它推出了首款服务机器人Robbyant R1,定位家庭、养老、医疗健康等服务场景。不过,根据多家媒体的报道,R1目前的出货量有限,更接近“验证模型的载体”,距离大规模走量尚有距离。
这是一个现实的处境。
在硬件本体环节,宇树、智元、银河通用、星动纪元等公司在硬件工程、供应链和量产上已经积累了数年,灵波的机器人产品力和量产能力还无法与它们直接竞争。
大厂具身地图上的“唯一”
把灵波放在中国大厂具身智能的地图上,它的位置有些特殊。
阿里在通义体系下推出了Qwen-Robot,但产品定位更偏平台工具,给机器人厂商提供多模态基础模型,本身不做本体,也不深入到具身大脑的操作层;腾讯的Robotics X研究院走“云+投资”路线,把大脑和算力卖给机器人公司;华为CloudRobo同样以云端能力为主。京东和美团采取重投资、轻自研的策略,聚焦物流和配送场景。
灵波是唯一一家同时押注大脑基座、世界模型和本体落地的大厂子公司。
![]()
蚂蚁灵波官网截图
但这个“唯一”也带来了问题。
灵波在蚂蚁集团内部需要与百灵大模型团队、支付宝AI团队争夺资源;在蚂蚁集团外部,仅阿里系内部就有多个具身智能条线“各自为战”,包括千问Qwen-Robot、高德世界模型,尚未形成统一的战略协同。
数据困局与开源的悖论
如果技术路线的不确定性是第一层困顿,那么数据瓶颈是更现实的第二层。
具身智能行业有一个被反复提及的残酷数字:真实世界数据与语言数据有几万到几百万倍的差距。大语言模型可以调用万亿级的人类语言数据进行训练,但机器人需要的物理交互数据,比如“怎么抓杯子不碎”“在湿滑地面上怎么保持平衡”,只能靠真机一点点积累。
灵波的数据从哪里来?
根据AIX财经报道,灵波的真机数据主要依赖生态伙伴供给,包括宇树、乐聚、星海图等合作厂商的真机测试数据。
这是一种“借鸡生蛋”的模式:灵波自己不造大量本体,靠合作伙伴的数据来训练模型。
但这个模式的脆弱性是显而易见的。
宇树科技刚刚推出了宇树UnifoLM-OminiA-0.3具身大模型,智元机器人有自己的世界模型和AgiBot World数据平台。一旦这些本体厂商认真自研大脑,数据供给随时可能收紧,灵波将失去最重要的训练燃料。
![]()
微博截图
全栈开源是灵波应对这个困局的策略:权重、代码、工具链、评测集全部放出,吸引全球开发者基于其标准开发,试图把自己变成“公共底座”。
但是,别忘记了具身智能头部玩家们自己也都在有意识布局“大脑”,如果它们自己的大脑做得比灵波更好,为啥选择灵波?
开源在标准未定型的阶段是建立生态的最快方式,但它本身不构成护城河。模型能力能否持续领先,才是灵波能不能守住“公共底座”位置的关键。
为什么要做这件事?
蚂蚁做具身智能,最直接的背景是战略重心发生了变化。
“具身智能”在2025年首次被写入政府工作报告,随后,上海、深圳等地相继出台支持政策。但政策红利之外,蚂蚁有一个更具体的业务逻辑。
蚂蚁的主业,支付、金融、健康,增长已见顶。但很多人忽略了一点:蚂蚁从来就不是一家纯线上的公司。
支付宝的二维码遍布全国数千万商户,蚂蚁的医疗业务(好大夫在线、阿福)直接连接医院和患者,芝麻信用渗透进租房、出行、政务等线下场景。
蚂蚁的触角早已延伸到线下,只是过去用软件和二维码作为入口。
在老龄化社会里,AI助手不仅要解决问诊这一个问题,最终还要有实体:陪伴、送药、康复、看护,纯软件解不了这些问题。
沈宇军在今年7月的一次技术分享中表示,“未来要更好地服务用户,肯定会进入到物理世界,这是业务的自然延伸。”
从这个角度看,灵波对蚂蚁而言,不是一次跨界冒险,而是主业的自然延伸。
对一家科技公司来说,做具身智能、做物理AI,是进入线下最深场景最合理的路径之一。蚂蚁必须走这一步,因为线下的刚需场景终究需要实体来承接。
但这条路的长度可能超出预期。
高盛团队在研报中认为,人形机器人技术拐点仍不明朗,能力尚不足以处理多种通用任务。高盛预计,到2027年全球人形机器人出货量约7.6万台,到2032年约50.2万台,步伐慢于市场预期。
灵波的200余人团队正在和时间赛跑。他们在一周内开源了六款模型,但把模型变成能在老人家里安全运行的机器人,还需要更长的周期。
CEO朱兴在公司成立之初说过一句话:“让人形机器人早日走进寻常百姓家。”
这句话的实现时间,目前还没有人能给出一个确切的数字。
*参考文章:
AIX财经《蚂蚁,为何狂卷具身智能?》
亿邦动力《一周开源六款模型蚂蚁灵波卡位“具身原生”》
科创板日报《WAIC观察:具身智能“深圳军团”,补齐人形机器人落地关键中间层》
=▹
联系我们 CONTACT US!
请添加微信xingminghui15
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.