![]()
建设社会主义现代化强国,关键在于科技自立自强。以科技金融支持创新创造,因地制宜发展新质生产力,加快建设现代化产业体系,是我国在"十五五"时期推动高质量发展、实现中国式现代化的核心战略部署。发展智能经济新形态,需要打通科技成果转化堵点、强化产业体系支撑、畅通金融赋能渠道,构建科技、产业、金融良性循环。在此背景下,《清华金融评论》推出《科创AI+》主题专栏,旨在深入阐释国家战略部署、汇聚权威观点、服务高质量发展大局,为政策完善与行业实践提供智力支持。
当前主流具身智能训练范式(例如VLA视觉-语言-动作架构等)主要依托一维语言序列、二维视频观测数据开展训练;模型最终却需要在由三维空间加一维时间构成的四维物理时空中感知、决策并完成实体交互。这种“维度鸿沟”被业内认为是机器人能力远不如人的底层原因。影身智能以自研数据采集系统为起点,构建原生4D基座世界模型,在制鞋涂胶、压底等双柔性工序上率先跑通具身智能规模化落地,并将4D能力延伸至数字文娱场景。本期围绕4D世界模型的底层逻辑、数据采集与基座构建、双柔性工业攻坚、商业化落地路径、行业周期判断与创业方法论六大议题,专访影身智能创始人兼CEO闵伟。
一
维度之困:机器人
为什么需要4D
Q:影身智能提出机器人训练存在“维度鸿沟”,训练用一维语言和二维视频,却要在四维物理世界里交互。这个判断是怎么形成的?它是否解释了当前机器人能力远不如人的根本原因?
闵伟:做机器人会发现一个比较大的痛点。大语言模型训练的是一维语言,生成也是一维语言,维度对得上。视频生成模型训练二维视频,生成二维视频,也同维度。机器人面临情况不同,训练用一维语言加二维视频,处理却要在真实的四维世界中进行交互。中间遇到了一个维度的鸿沟,这是现在机器人能力远远不如人的底层原因。
与人类对比会更加清晰。算力上,机器人优于人类。功率上,人脑二十瓦,机器人接上电基本没限制。训练数据上,做具身遥控操作的真机数据已经百万小时,视频数据上千万小时。反观人类,一个小朋友一天训练八小时,一年365天,加起来不到三千小时。三年一万小时,十万小时要30年,百万小时得三百年。但一个十岁孩子什么都会干,你教他刷碗,几分钟就学会,机器人几个星期不一定学得会。
问题出在数据维度。我们在3D、2D基础上加了时间维度,甚至力学这种拓扑深度,严格跟物理世界对齐,所以叫“原生4D世界模型”。真实物理世界不是二维像素组成的,是原子分子组成的动态点云。二维像素世界表达不了很多东西,比如风没有RGB,要流动需要在三维空间里,那么该如何在像素里表示风?还有接触,只有三维空间才有真正意义上的接触,没有三维就分不清遮挡和接触,甚至穿模。我们一开始就选了4D这个方向,底层观察就是维度。
Q:当前行业世界模型路线分化明显,有基于互联网现成数据的,有自研原生4D数据体系的,不同路线之间的性能代差有多大?
闵伟:我们认为具身智能的模型根据基座可分三代。第一代是VLA,基座是大语言模型,核心能力来自里面的语言模块,局限性也来自基座大语言模型。其中没有那么多物理规律,没有3D空间,所以能力受到极大限制,只能做非常简单的任务。第二代是当下火热的世界模型,基于视频生成模型,但视频生成模型会有幻觉(sim-to-real),幻觉的本质是维度缺失引起的。
没有3D或4D的数据,在像素空间如何避免穿模?没有三维空间概念,如何解决占位问题?只能拟合像素,无穷无尽地打补丁。第三代需要4D基座,用4D数据训练4D模型,这才是真正能更好学习和理解物理规律的世界模型。如果数据格式本身就是4D的,是跟真实物理世界对应的点云,很容易知道空间里一个点如何被占据,碰撞穿模都能避免。当前整个行业都缺4D基座,我们要做的就是这件事。跟其他路线比,加的是维度,尽量贴近真实世界,从真实世界采集真实数据,保留物理世界的信息让模型去学。那些表征手段、强化学习、因果推理,都是中间的方法,底层还是数据来源问题。就像造摩天大楼,用木头造顶多造成黄鹤楼的样子,十层以上就上不去了;想造一百层得上钢铁。原材料是核心。
二
数据底座:
原生4D基座
Q:选择数据采集系统用普通RGB摄像头合成高精度4D时空数据,不用深度相机,这个选择背后的技术逻辑是什么?相比行业主流的遥操作或深度相机方案,成本和效率优势体现在哪里?
闵伟:6个阵列RGB摄像头架在工位上,不需要进行穿戴,就能实现无感采集。不用深度相机的原因是,深度相机每个点都是单独测量的,比如测桌面,近的点测出来高一点,远的点测出来低一点,会有各种误差。这样测出来的两个点之间没有逻辑关系,会出现错误。比如,明明是一个平面却会有折叠。我们用算法做深度,一致性很好,一个平面就是一个平面,整体有误差但不会折叠。现在整个行业都在往这个方向发展,用模型的思路做,比用深度相机强。
成本上,一般的具身如果用VLA,需要大量真机数据。我们只要多几个摄像头,无侵入式无感采集。并且,基座模型三维空间加一维时间,既支撑机器人又可支撑数字娱乐,它只需要理解底层的物理规律。力、触觉这些更高维度的感知,通过后训练阶段分开做即可。
Q:数据飞轮被认为是4D大模型赛道的核心壁垒。影身智能的飞轮启动门槛有多高?在双柔性制鞋这种极端复杂场景中沉淀的数据,对后续跨行业泛化的价值在哪里?
闵伟:可以把我们这种柔性当作桌面里的corner case来看,各种极致场景有极致难点,也会产生更丰富的信息数据。复杂场景的数据价值更高。如自动驾驶,四平八稳的高速路数据没有价值,各种corner case才更有价值。或者说我们走的是real2real路线,直接从真实作业场景获取和迭代数据,而不是主要依赖模拟或合成。域差距小,落地更可靠。真实场景部署产生的高价值4D数据,包含成功和失败案例,直接反哺模型迭代。模型能力提升后,又能更好落地新场景,形成正向循环。用这些数据做通用基座,再做后训练,从双柔性工业场景切入,后面还可以进入本地生活。先把最难的部分做掉,后面加简单任务就容易了。目前没有发现其他公司,可以实现大规模落地的双柔性生产。
三
双柔性攻坚:
制鞋产线的破局
Q:制鞋是传统自动化最难啃的骨头之一,多数具身智能公司避之不及。影身智能为什么偏偏选了这个场景?所谓“双柔性”到底难在哪里?
闵伟:我们提的“双柔性”有两个含义。第一个柔性是小单快反,生产的东西可以无限变换;第二个柔性是被操作对象是软的,二者结合起来是最难的。
以制鞋行业为例,鞋厂普遍采用代工模式,单家工厂可承接数十个品牌的订单,每个品牌又包含数十款鞋型。如果具身智能模型泛化能力不足,每上新款式就需要反复调试,运维成本会大幅抬升。反观汽车线缆场景,虽同样使用柔性作业工艺,但属于长周期稳态生产,单一车型的生产周期可达数年,产线无需频繁切换工况。而鞋服代工场景SKU迭代快、款式切换频繁,对模型的通用泛化能力提出了极高要求。
我们创业时反其道而行之,专注做困难的,而非简单的。做难的缺点是花费时间较长,短期内没有成果。但难的事情一旦突破,就有壁垒。简单的事情没有壁垒,其他公司选能快速落地的简单场景,如物流等,在他们眼里制鞋异常困难,模型不够、工程化能力不够突出就很难切入。
我在阿里一直做机器人,上一轮做配送机器人、酒店机器人、餐厅机器人,全部经历了一轮竞争内卷,卷到最后所有人亏本。自己创业后第一要务就是不做简单的事。现在积累了两年,卡在这个时间节点干出来了。
Q:涂胶和压底已经跑通规模化落地,实现零产线改造、零停工、零驻场,单工位效率最高1.5倍,良品率99.9%。这套“三个零”指标背后最大的工程化挑战是什么?
闵伟:实际改造产线,我们的设计目标就是直接对标人。弥补一个劳动力缺口,就把人做的事情完整地用机器人做对标。不改造产线,只嵌入现有半自动产线。
去年五月第一代机器人是人形双臂的。进化几代以后不再坚持人形,反而更适用了。从人形回到了工厂最简单适用的各类形态,才能真正上流水线。
工程化上,机器人进工业落地有两个最大难点。一个是三个九以上,99.9%以上的成功率;另一个是节拍,要赶上流水线的速度。要做到三个九,符合人的节拍,才有底气做推广,这也是为什么干了两年才开始大推广。在不太成熟的情况下盲目追求大规模推广,为了营收去强做,难以长期发展。
鞋业的实验产线,40度高温、胶水气味弥漫,工人们低着头重复同一个动作,很苦很累,对身体也有危害。机器人接手涂胶和压底后,工人就不用做有危害的工作了。我们的机器人效率也很高,面对不同鞋型、摆放歪斜,无需重新编程就能识别并操作,单工位效率达到人工1.5倍,良品率99.9%。45人产线现在只需5人运维。我们已经可以实现,发现刷偏了,它会停下来重新补救,跟人的反应类似。
Q:轻工业利润率偏低,单台机器人成本需控制在替代1至1.5个人工的经济学红线内。千台级排产阶段,成本曲线处于什么位置?怎么在低毛利场景里跑通商业模型?
闵伟:规模化生意的盈利率不可能很高。做科技项目单个毛利很高,大概在 100%—200%左右 ,但研发成本一除就没。能大规模复制的,一定是赚钱的,这是优先劣后的选择。
我们选的场景足够难,但一旦突破就好复制。制鞋、制鞋涉及压底、涂胶、缝纫、打包等许多工序,我们已经覆盖了压底、涂胶,缝纫和打包等正在研发。先把难做了,做简单的容易。先做简单的,再去做难的,就难了。成本上,我们用普通摄像头而不是深度相机,用算法补齐硬件问题,积累数据后做通用基座。数据采集是无感采集,不用给工人戴设备,成本比遥操作低很多。
四
从工厂到家庭:
落地路径与商业版图
Q:您判断技术落地普遍是“先B端后C端”,影身智能也是先深耕工业。从制鞋产线到家庭场景,中间需要跨越哪些门槛?4D基座模型在不同场景间的泛化能力是否已经验证?
闵伟:所有技术一般都是先B端落地,然后才C端,这是行业普遍规律。移动互联网那个时代也是先避开C端,阿里最开始做电商也是B2B,然后才B2C、淘宝。C端有大量基础设施要求,成本、容错各方面要求更高。B端总能找到细分场景先解决问题,积累技术、经验、数据,再进C端。
我们先深耕工业,这是目前占比最大的。但4D基座是通用的,物理规律面向所有行业。制鞋跑通后,向箱包、家居、服装等同类柔性制造行业复制,再往居家照料、清洁、餐饮等生活场景延伸,终站是家庭。
家庭确实更难,非结构化场景。安全隐私一直有问题,因此家庭一般用雷达或毫米波取代摄像头。但我们认为还是要用摄像头,信息量远远高于雷达。很多家庭有保姆,保姆和机器人比,机器人在隐私方面反而更好控制一点。家庭本质上就是各种任务的集合,无非是如何切入的区别。
Q:具身智能为主的4D能力,同时可以向数字文娱商业延伸,这两块业务的关系怎么处理?
闵伟:我们的商业模式是“本体加Token”,本体销售加模型能力订阅。客户买的不只是硬件,还有持续迭代的模型能力。4D基座是通用的,工业场景跑通后,这套能力也能延伸到数字文娱。我们正在做4D演唱会、4D游戏、4D直播、4D电影等。4D显示器也在筹划,做互动引流。这些不属于工业智能化主轴,但4D基座的通用性让它在内容领域也有想象空间。不过现阶段,数字文娱是辅助,工业是重点。
Q :千台级排产对供应链管理和量产一致性提出了哪些挑战?
闵伟:产品本身质量过硬是基础,起码做到三个九、符合人的节拍。千台级排产,供应链管理、量产一致性控制、售后运维体系都是新挑战。我们分三个阶段推进产品扩展。第一阶段聚焦涂胶、压底两类核心工序,形成可交付、可验证的产品。第二阶段能力向工艺知识学习延伸,拓展跨场景迁移和柔性力量协同。第三阶段形成制鞋模型能力,覆盖数字员工、成品包装工作站。跨行业复制时,4D基座模型的泛化能力是关键。我们不需每个新行业重新积累示教数据,基座理解的是底层物理规律,换行业主要是后训练适配。
五
路线之争与
周期判断
Q:自动驾驶和工业具身都涉及物理世界理解,但很多做自驾的人转来做机器人,路线差异很大。您怎么看这种差异?同时,具身智能现在这么热,会不会像自动驾驶一样经历周期性?
闵伟:自驾和工业具身确实不一样。自驾的难点是时间和安全,毫秒级反应,安全方面三个九不够,得六个九。工业领域做到三个九以上,造成的损失可控、可忍受。自驾即使做到最后,司机出事故有自然人承担法律责任,算法出问题谁担责是个问题。
自驾容易的地方在于自由度只有三个,不需要跟物理世界交互,只需要避免碰撞。场景有交规,在规则范围内做决策。物理世界没有交规,自由度很多个,还得做交互,特别是柔性物体的交互更难。
如果没有大规模商业化落地,会经历低谷,跟2000年PC互联网一样,当时觉得互联网会取代一切,硅谷曾经有个药品互联网公司估值炒到很高,但是后来倒闭了。所以一定会经历波动过程,但经过两年煎熬后,我们对实现行业目标比较有信心。商业化落地有自身造血能力,就更有底气做基础研究,更有底气做跨行业复制。
Q:中美在具身智能领域的差距,硬件、场景、算法各有优劣。中国工业场景优势能否转化为数据优势和模型优势?影身智能在第三代4D基座上希望扮演什么角色?
闵伟:分几个方面看——硬件,国内有供应链,优势蛮大,全世界机器本体绝大部分都在国内生产;场景和数据,做居家国内国外差不多,场景优势最大的是工业,中国是全球最大工业国,生产环节最多,场景最多,数据最多,做工业中国有很大优势;算法技术、算力方面,第一代VLA、第二代世界模型,中国是追赶姿态,我们希望在第三代能够引领全世界。
六
创业方法论:
科学家+产业老兵
Q:从清华直博到阿里机器人团队技术负责人,再到2024年创办影身智能。产业经验加产学研的组合是否有利于创业?
闵伟:团队结构上,研发人员占比超90%,80后高管带00后团队专注产品工程化、场景交付和商业化,科学家带00后硕博团队主攻4D世界模型、4D数据生成等核心技术。这是科学家+产业老兵的组合,科学家有技术理想和前沿判断,产业老兵知道怎么把技术产品化、工程化,怎么运营交付,两者刚好匹配。
Q :对于现在进入具身智能赛道的年轻创业者,您最核心的建议是什么?选择赛道时应优先看技术红利还是场景密度?在4D世界模型这条路上,最大的“坑”是什么?
闵伟:创业最大的考验,是在没有突破的时候,能不能耐得住寂寞去坚持一个正确的方向。难的事情做不出来的时候,你会想要不做个简单的先搞点营收。但简单的事情先做了,可能难的就更难做了。
选赛道,我觉得先看场景密度,再看技术红利。场景密度决定数据飞轮能不能转起来,技术红利是阶段性的。具身智能的创业,商业敏感性特别重要,还有牵引能力。在大厂如果做成熟业务,体会不到创业的高度不确定性。我之前在阿里就是做机器人创新业务,能直接感受到跟自己创业没什么两样,面对的是高度不确定的业务、市场和技术的变化。这一轮科技革命,我们想发出一个邀请,邀请更多创业者一起来建设4D生态。4D电影、4D游戏、4D显示器,未来会迎来一个4D的世界。高维模型是一个基座,会衍生出很多行业,所有跟内容相关的行业都会迎来革命。显示器是二维时代的产物,手机也是二维时代的,都是为二维内容服务的。为4D内容服务,一定会有新一代的硬件、应用和场景,对社会方方面面都会有一场革命。
(本文为清华金融评论&清友创联联合策划“科创AI+|科技产业金融”专栏的主题访谈)
Review of Past Articles -
01
02
03
04
关于《清华金融评论》·《科创AI+》
《清华金融评论》坚守“建言金融政策,引领金融实践”的办刊初心与使命,《科创AI+》栏目聚焦新一轮科技革命与产业变革的时代浪潮。针对当前AI赋能科技创新、产融深度融合、前沿技术落地等热点话题进行深度剖析、案例分享与访谈解读。解码科创企业成长逻辑,洞察AI技术应用边界,探索“科技- 产业-金融”协同发展新路径。
来源 | 本人访谈
编辑 | 兰银帆
审核丨秦婷
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.