在具身智能的喧嚣浪潮中,你是相信一个能泛化处理一切任务的“万能大脑”,还是更愿意押注把感知、决策、控制层层拆解的分层架构?这不仅是技术路线的选择,更像一场关于智能本质的哲学分歧。本期节目,我们与苏度科技CEO韩铮进行了一场毫不回避的深度对话,将他基于Sim-to-Real与分层架构的技术路线,摊开在硅谷盛行的黑盒端到端方案旁边,让两套坐标系正面交锋。 韩铮首先毫不客气地戳破了一个流行错觉:许多人以为只要把大模型塞进机器人,它就能像科幻电影那样自主走进人类生活。但在他看来,具身智能今天最大的瓶颈不是算力不够或模型不够大,而是3D数据——真正的、物理世界中可交互的空间数据。他打了个比方:如果说语言模型吃进的是千亿级文本语料,那么当下多数具身智能项目能接触到的有效3D操作数据,连语言模型的零头都不到。而一旦缺乏足够密度的物理交互数据,任何端到端系统都会在真实环境中频繁“走错路”——不是机械臂失准,而是机器人根本不能理解一个半开的抽屉意味着什么,或者不明白玻璃杯掉落为何是不可逆事件。 这便引出了第一个路线分野:数据策略。韩铮团队选择用仿真环境来弥补现实数据的稀缺,通过Sim-to-Real迁移,把数字世界里数百万次低成本试错积累的策略,蒸馏到真实物理机体上。这样做的好处是可以在虚拟仓库中安全地让机器人摔打无数遍,直到它学会如何应对不规则堆叠的纸箱。而硅谷一部分纯端到端派则认为,仿真永远无法模拟真实世界的混沌,他们坚持用成百上千台机器人经年累月在真实场景中采集数据,试图让模型直接从像素中习得操作逻辑。韩铮对此的评价颇为直白:“你不能指望一个只在游戏里学会开车的人,第一次上路就能安全抵达目的地。”但他同时也承认,纯现实采集路径的成本和时间壁垒,可能让中小公司永远追不上拥有万台机器人集群的超级巨头。 第二个更隐蔽的分歧,藏在架构哲学里。目前硅谷备受资本追逐的端到端模型,崇尚从传感器输入直接输出关节控制指令,中间不再有人类定义的感知、规划、控制等模块。这听起来优雅又彻底,但韩铮给出了一个工程上的反问:当机器人执行抓取任务失败时,你如何去调试一个黑盒?是视觉编码出了问题,还是动作解码不够平滑?分层架构的支持者则坚持把系统拆解为可解释的模块——先做3D场景理解,再规划操作轨迹,最后执行底层控制。韩铮强调,这不仅是工程透明度的需要,更是安全性的底线。在工业场景中,如果一个机器人误判了货物位置,你可以通过日志迅速定位是哪个模块给出的错误置信度;而在端到端系统中,你很可能得到的只是一个“整体失败了”的结论。 不过,这场讨论并没有把两种路线简单地钉在“对”与“错”的两端。韩铮同样承认,分层系统在某些灵巧操作上仍有僵硬之处,而端到端系统在应对长尾情况时偶尔展现的“灵光一现”,也正是具身智能最诱人的前景。只是他提醒行业,在估值飙升、泡沫隐现的时刻,我们需要问一个更冷静的问题:我们究竟是要造一个只会表演炫技动作的demo,还是打造一个能真正在仓库里稳定搬货上千小时的可靠劳动力?从中国制造业土壤里长出来的答案,往往更倾向于后者。 当我们把镜头拉远,中美具身智能竞赛的图景也因此变得更加立体。硅谷依然在信仰“大力出奇迹”的规模律令,用堆算力、堆数据、堆机器人本体的方式寻求通用技能。而苏度这一类中国公司,则试图在物理约束更具体、场景目标更聚焦的框架下,走出一条模块化精密进化的路径。韩铮在对话尾声说了一句耐人寻味的话:“具身智能不会出现一个iPhone时刻,它会像电力革命一样,在无数个车间、码头、医院里悄悄发生。” 这场技术分野,或许就决定着谁先点亮那些沉默角落里的第一盏灯。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.