在2026世界人工智能大会上,苏度科技用一场现场演示,呈现了机器人零样本通用抓取98%的单次成功率。这个数字背后,是一家成立不到一年的公司对硅谷主流技术路线的明确迥异:他们选择了一条软硬件协同、上下分层架构的路径,而这条路上,虚拟世界中的数百万年“进化”正成为现实操作能力的基础。
苏度科技联合创始人兼CEO韩铮,在《硅谷101》播客中,拆解了这条路径的选择逻辑。与当前多数玩家聚焦于构建单一端到端大模型不同,苏度的系统将上层任务规划、环境理解,与下层具体物体操作彻底解耦。韩铮判断,这种分化并非一时兴起。“接下来会有更多的硅谷公司重新回到‘上下分层’的方向上来。”他对具身智能领域的未来竞赛给出了明确预测。
![]()
正方观点在苏度内部有着深厚的学术积淀。联合创始人苏昊是ImageNet的核心作者之一,他将2D视觉中大规模标注数据的思路延伸至3D空间,在斯坦福期间建立了ShapeNet数据集。然而,3D世界的复杂性使得数据获取遭遇瓶颈。从包含几十万基础3D模型的ShapeNet,到标注部件约束的PartNet、仅有不到3000个物体带有动力学干预信息的PartNet-Mobility,每一步精度提升都伴随着数据量的急剧衰减。韩铮指出,这种几何精度对机器人操作至关重要,因为“像把线缆插入孔位,要求必须在亚毫米级以内;如果仅靠2D视频推测空间关系,十厘米的误差对操作来说绝对不能忍受。”
反方代表则是硅谷主流正在押注的“纯大脑”路线。以Physical Intelligence、Skild等公司为例,其核心思路是让模型从海量互联网视频中学习通用表征,通过扩大模型规模来涌现操作能力。韩铮认为,该路径在导航层面或许足够,但一旦进入需要精细操作的场景,其三维信息不全、不准的缺陷便暴露无遗。一个直观的对比是,苏度基于Sim-to-Real范式,让机器人在高精度虚拟环境中完成数百万年的试错训练,再将策略迁移至物理本体;这本质上是一个复杂系统工程,而非单一模型的魔法。
对双方路径的拆解最终指向一个判断:具身智能的下一阶段,很可能是本体、大脑与虚拟训练系统的耦合。韩铮在对话中提到,苏度之所以在本体制造上从一开始就选择全栈,正是因为多年的软件积累告诉他们,“如果不碰本体,大脑的能力就难以展现和验证”。这一判断也引出了他对最值得关注对手的聚焦——DeepMind与波士顿动力的组合。两者结合了顶尖的模型能力与成熟的本体控制技术,恰好映射出上下分层架构在行业最强组合中的雏形。当硅谷多数公司仍在追求更大规模的端到端模型时,回归系统性分层或许才是将98%的虚拟成功率兑换为现实生产力的真正钥匙。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.