![]()
今天, 从今早8点出门开始,我一天都“泡”在上海外滩大会。
今年外滩大会,我就两个词的感受:人多亮点密、具身智能机器人“味”特别浓。
上午开幕式上,通过演讲、采访、观点和insight,我希望看看 大模型和具身领域的最新发展趋势。
现场包括源码资本投资合伙人、美国国家工程院外籍院士张宏江、普林斯顿大学教授王梦迪、苏度科技联合创始人兼CEO韩铮、蚂蚁灵波科技首席科学家沈宇军、破壳机器人创始人许华哲、自变量机器人CEO王潜的分享。
会后还做了一场与韩铮、许华哲的群访。
此外,下午我还参加了世界模型论坛,现场包括忆生科技创始人、香港大学计算与数据科学学院创始院长马毅教授,大晓机器人创始人王晓刚,生数科技CEO骆怡航,忆生科技CEO石志儒,忆生科技联合创始人兼CTO杨言超教授,源策未来(Archon Robotics)的联合创始人兼CEO是李天羽博士,以及上海科技大学研究员、助理教授、YesAI 实验室负责人、瞬适科技创始人石野教授
并且我还围观了阿里云创始人王坚下午的演讲,拿张图感受一下现场的爆火。
![]()
总结一下:目前具身智能行业开始有了一点共识,而世界模型赛道目前依然处于非共识阶段,而GPT-6 Astra已经成为热词被反复提及。
下面挑一些关键点enjoy一下。
张宏江:Token是新一代“茅台”
“最具价值的Token(词元),就相当于我们新一代的茅台,用户应该选对茅台,而不是一般的烈酒。”
![]()
张宏江在演讲当中点出了这个观点。在他看来,AI是人类有史以来发展最快的技术浪潮,前沿AI模型的智力测试已突破人类平均水平。
与此同时,AI的递归式自我改进能力,进一步让AI在物理世界与虚拟世界之间形成自我大循环,呈现出前所未有的加速度。
技术层面的突破让经济层面出现新的形态,多个Agent(智能体)之间正在形成经济关系网络,智能体经济简而言之就是Token经济,但不同的Token也有价值高下之分。
在Agent Economy(智能体经济)阶段,由于主角由人转移为Agent,因此一系列的变化随之发生。例如在软件领域,正在从“人使用软件”转向“Agent使用软件”。张宏江认为,Agent经济学本质上出现了范式变革。
但软件被改变并非AI带来的价值的终点,张宏江表示,更加值得关注的是AI对“组织架构”层面的影响。
他表示,在Agent经济学时代,企业组织需要重新认识到巨大的变革,例如OPC这种生产模式下,“一个人+多个Agent”的组织形态已经让公司规模进一步小型化。
蚂蚁集团CEO韩歆毅则提出三个层面的产业变化:最表层是流量逻辑的重构——从“时长竞争”转向“意图竞争”,个人助理成为核心入口,商家营销不再是投流抢曝光,而是精准匹配用户意图提供服务。
简单总结,宏江老师依然非常看好AI带来的商业落地,尤其是Anthropic比OpenAI商业和算力规模更强下,AI Coding对经济学影响正在扩大。和去年外滩大会类似,宏江老师认为:大家不仅要做AI,而且要学会把AI正确转化成经济学。
具身智能面临Astra模型竞争,但它无法完全替代机器人真实物理AI任务
高质量数据和可靠性,成为具身智能领域为数不多的共识方向。
苏度科技联合创始人兼CEO韩铮表示,机器人在科研场景和商业化场景下的要求,其实和早年工业机器人、自动化设备是一样的:高成功率,是绝大多数任务商用落地的前提。
现在做的很多测试,100个任务里可能只有1到5个,能接受80%左右的成功率,允许二次纠错。但剩下90多个任务,无论是首次执行还是快速纠错,几乎都要求接近100%成功率。
他指出,在这个前提下,和传统自动化设备的区别在于:机器人还要对物体、环境具备泛化能力,并且不能依靠高昂的后训练成本来弥补效果。不然每落地一个场景,就要大量定制调参、发生过拟合。刚才主旨演讲的嘉宾也提到了这个问题。
“所以推进商业化,对我们最大的考验首先在算法层面:必须做到高成功率同时保有泛化能力。当然后续还会面临设备可靠性、运维服务等一系列绕不开的挑战。”他说。
换句话理解,韩铮认为,仿真绕不过去是因为真实数据太慢,尤其是在大规模预训练阶段,仿真可以提供更高效率的数据来源。他们现在已经在做抓、放这类技能,一些任务几乎能达到 100% 成功率。
在沈宇军看来,机器人最终要在物理世界里干活,观测来自自身传感器,而真实传感器一定会有误差。仿真的难点不只是sim2real(合成数据)的 gap,更在于real2sim能不能规模化。这些东西很难被完整搬进仿真。
这其实是具身智能今天最核心的路线分歧之一:一边相信仿真可以把规模先做起来,另一边更强调真实物理世界里的复杂性和不可替代性。
所以,如果说通用AI模型要真正进入具身智能,它依然必须面对机器人数据、现实世界评测、硬件(本体、灵巧手、触觉等)、算力、仿真和部署等挑战。
而更为惊喜的点在于,OpenAI最新发布的模型GPT-6 Astra,开始调度3D生成,并且使得具身智能技术变成了海外通用模型驱动,而非具身智能模型,引发了更多的关注。
自变量机器人创始人、CEO王潜表示,未来,智能的本体存在于数据里。模型更像训练阶段的蒸馏器和部署阶段的容器。Coding之所以率先快速进步,并不是因为语言模型自然获得了编程能力,而是因为代码数据更容易生成、验证和反馈。
“从去年年初的时候开始, OpenAI、Anthropic。其实大量的在采购机器人的数据,以及他们自己也有小规模的数据工厂在去采集机器人的数据,他们也去招了很多机器人的人。 所以我觉得这个其实不是一个什么特别奇怪的事情啊,它本来就是一个非常好的多模态的模型,如果里面再加了很多的机器人数据的话,这个能够做这种事情,好像真的不是什么特别奇怪的事情。”王潜表示。
王潜认为,如果 OpenAI 或 Anthropic 也要做具身智能,它们同样需要依赖数据基础设施、验证基础设施以及其他各类基础设施,需要从现实世界收集数据,或者构建仿真器 —— 包括承载一部分世界模型的仿真器。如果它们仍然要做这些事,那在他看来,它们不过就是又一家具身智能公司而已,因为这些难度并不会因为它们在基础模型上的优势而降低。所以,反而是具身智能公司可能拥有实质性的优势。也就是说,通用智能的天花板以及发展速度,并不会因为这些大模型公司的入局而出现明显提升。
对于基础模型通过其他领域的通用智能泛化到具身智能上面,王潜认为可能性也不大。
“我们和 Anthropic 或者是 OpenAI 唯一的差距,就是他们是把这些数据,把这一套的Infra融入在了通用的大模型里面,语言模型里面,我们只是在做一个行业专用模型。反过头来,通用的大语言模型,是没有办法在机器人上以一个合理的速度做推理,合理的速度来去做部署,相应的,我们确实是需要一个单纯的具身的模型来干这件事情,可能确实才是一个更高效率的一个做法。”
在王潜看来,通用大模型公司与具身智能企业的区别,可能更多在于前者将机器人数据和相关基础设施融入通用模型,后者则面向具身领域构建专用模型。考虑到机器人对推理速度和部署效率的要求,专用具身模型可能是更高效的选择。
尽管如此,GPT-6操控机器人的表现,确实为具身智能行业带来了一个启示:通用数据预训练是有效的。
王潜认为,Astra展示了这一做法的积极价值。对于正在开展预训练的具身智能企业而言,持续完善数据和验证基础设施、在预训练阶段加入更多通用数据,是一条应该坚定走下去的路。
许华哲则进一步表示,Astra 确实是一个非常惊艳的东西。
“我们内部在它能用得上的当天,就立刻做了一些测试,我们的感受是如果把具身的任务看成里面需要语义的泛化,需要空间的泛化,加上需要物理的泛化,这三个点的话,它只有物理做的相对是很弱的,语义和空间做的是相对很强的。简单来说,我们给 Astra 一个提示词,它全认识桌面上的东西,无论是任何类别,它全认识,它一定会往那个对的地方去走。”许华哲称。
第二呢,原来 VLM 模型啊,或者是大模型,基本上就走到那,然后在那就开始乱动,就结束了。但 Astra 很很独特的一点是它能抓起来。而且能抓起来。非常难抓的东西,比如说一根筷子放在桌面上,这种小的物体其实一直对机器人来说都得,你得顶到桌子,甚至得在桌子上打打滑,才能抓起来的。那 Astra 现在也是能抓起来。所以Astra在整个三维空间,不光是二维空间,效果都很好。
“但是当我们让它去做一些带物理接触的复杂任务时候,比如,用筷子挑开一个东西。这个时候他就开始不太行了,这也是具身机器人公司最后的阵地,就是怎么样理解这个物理变化。我们也拿它尝试了像什么叠盒子、叠衣服这种,具身公司很喜欢做的事情,包括极复杂的任务麻婆豆腐,这个Astra都是做不了的。所以我们看到,Astra 其实能做的还是相对来说空间语义上面的这些具身任务。”许华哲表示。
许华哲认为,未来,应该是大模型跟具身模型再到物理世界应该是连接在一起组成一个完整系统,才能真正把这个事情解决。
沈宇军表示,还是回到机器人具身模型的工作逻辑:机器人执行任务,高度依赖本体搭载的各类传感器,传感器需要持续获取输入。即便机器人正在执行操作,传感器也不能中断数据采集,这一点和当前数字世界里多数大模型的对话模式有明显区别。机器人必须在这种持续感知的状态下运行,源源不断获取输入,这个过程无法中断。
“我认为,具身模型最终会成为更高阶基础模型的工具。当然,既然定位在工具层面,它就需要配套专属的训练范式 —— 因为它要直面真实场景,持续接收输入并输出动作策略。具身场景,或许能给 Astra 这类高阶交互式模型,指明后续的发展方向。”
沈宇军进一步强调,如果真的机器人能够逐渐走入生活中,带来更多跟物理世界、跟现实生活更多数据之后,这些数据有可能成为更高级的、所有大模型公司的新的语料,可以基于去把设备变得更智能,而不是一个冷冰冰躲在后面的智能体,它反而可以跟人一样感受周围环境。
具身智能的高估与低估
最后问到,哪些东西在具身领域被低估了,又有什么东西在具身领域被高估了?
韩铮认为,目前最被高估的,或许是外界对中国供应链先进程度的认知。就具身智能迭代真正需要的供应链成熟度而言,还有不少工作要做:一方面要有足够的产量支撑,另一方面,许多关键组件如传感器,如今仍散落在汽车、工业机器人等成熟行业里,尚未真正服务具身场景。眼下具身领域的供应链水平,距离大工业制造仍有差距,但他相信,在中国这个问题接下来一定能被解决。
他还回应许华哲老师提出的99.9%目标。韩铮认为,中间能否采用一些非后训练过拟合的方法,值得探讨。这个时间可能会很长,但难度不必太悲观:随着稳定可靠的技能不断出现、上层各类模型组合持续推进,未来一到两年内,大家会看到某一大类领域任务在各行业中被快速处理;不过他也坦言,若要让 99.9% 的任务都能完成,确实需要很长的时间
会后采访时,韩铮补充称,首先,中国是整个机器人和具身智能里面供应链最发达的地区,但第二点,具身智能现在需要的供应链还不太成熟,虽然选择中国肯定是全球最多的,但在选择一些关键器件和零部件时,从科研、准备原型机到大规模量产,中间其实还有好几步。比如汽车行业、新能源汽车,都要经历一系列从原型到试产车测试,再到量产,供应链其实还要去迭代。但是今年我们其实都面临着挑战。
“对于工业和民用都要去接触的时候,核心的元器件包括组件的成熟程度,我们希望也能像新能源汽车一样,从早期15年前大家开始尝试的时候走到现在的成熟程度,中间的路还是要有,但我觉得这个事情肯定会发生,很多问题都会逐步解决。”韩铮表示。
沈宇军表示,当前被低估的是具身作为一个复杂系统工程本身,现在大家习惯把落地、解题成本等问题统统与模型性能挂钩,但事实并非如此。真正决定具身智能落地的,是整个系统的鲁棒性加上完整的商业逻辑,模型只是其中一环,而这一环之外的东西恰恰很少有人谈论。
沈宇军认为,当前大家可能高估了训练模型的技术,行业里有一种声音:具身要么被数字世界的模型降维打击,要么复刻其路径,攒一批物理世界数据,按旧方式训练就能训出具身模型,但他觉得这并不成立。具身会与数字世界走相同的模式,却一定不会走相同的技术路线,因为最终是应用场景决定了模型的形态。
“数字世界是对话式的,而具身要求机器人一边工作一边推理,二者并不互斥 —— 你不能要求机器人在干活时屏蔽掉一切外界输入。正因出发点不同,具身一定会形成自己的新训练范式,能够持续处理物理世界的信息,7×24 小时甚至全年无休,这与现在用完即关的模型截然不同。所以在训练技巧这一点上,他认为是可能被高估的。”沈宇军称。
王潜表示,如果五年后回看,大家应该会发现自己低估了具身智能的重要性和潜力。尽管今天具身已被视为 AGI 的重要组成,但人们或许还没有真正理解它。数据之所以重要,是因为它包含了一部分其他方式无法获得的智能能力,复杂的物理交互、各种物理过程、传感器的噪声,以及物理世界本质上的不可控,都无法通过视频、3D 甚至代码来获得。
“人类科学研究的历程表明,这两种思维方式某种意义上无法互相弥补。要构建真正的 AGI,这部分能力无法回避,至于训进同一个模型还是分层训练,只是小问题,关键是要从真实世界、仿真或其他途径把这些能力注入 AI 系统。”王潜称,大家同样低估了具身的重要性。语言模型可以修改训练方式、调整训练流程,但本质上需要的更多算力、更多芯片、更多电力,它无法自己创造,但把时间放到五年后,相信大家会意识到,具身智能正是不远的将来能干成这件事的载体,真正意义上的 RSI 才会到来。
王潜强调,也许有朝一日,中国要走出一条自己的 AI 发展之路,具身可能是其中很重要的起点,或许未来每一家公司都会训练自己的语言模型,也未可知。
许华哲表示,他觉得被高估得相当明显的,是大家对数据量的追求。市面上有人说自己有100万小时数据,有人说有几百万小时,还有人念叨谁谁买了多少数据、不买就落后了。但实际上,目前已经能看到一些用超大体量数据训出来的模型,并没有超越预期,甚至不比几万小时训出来的更好。所以,单纯盲目追求数据量这件事,在他看来被严重高估了。
对于被低估的,许华哲认为,整体具身智能模型的进展。大家一说具身智能解决通用问题,动辄五年、十年,但他的视角是:三年内,具身智能就能在很多地方开始提供服务,而且是通用的服务,不是后训练出来的专用服务。
会后交流时,许华哲强调了一个点:今年行业应该会批量看到真正意义上的“泛化”,但是它可能没有办法泛化到所有任务上,而是在各个不同地方用同一个模型,做一系列的任务,这在过去的三年里面是没有看到的。
“所有模型一定在我的办公室、我的工厂或者我的场景里面看到,这是最核心的能力变化;而第二个能力变化,就是做长程任务的能力变得越来越强了,现在大家可能做的任务很多时候都是从几分钟到10分钟到一小时甚至更长的时间,然后持续不断的去做这样的一件事儿。这个事情其实依赖整个系统,第一模型的方法能力要有,第二,整个硬件系统要有足够的稳定性、可靠性,第三是在这个过程中整个的场景的SOP要足够准确。”许华哲表示。
对于具身智能泡沫话题,许华哲强调,机会多的地方泡沫一定大。泡沫是预期和实际中间有差距。如果追的速度足够快,能追得上大家的预期,这个泡沫相当于就填实了。
“具身智能的发展它不是单纯砸资源,它是需要大量的资源,但是你也需要探索出正确的路,然后往那条正确的路上疯狂的去追资源才可以成功。”
以下是这次智能纪元AGI与韩铮、许华哲约71分钟的媒体对话。
由于速记整理到约2.1万字,韩铮回答15次、许华哲回答19次,所以下文内容有润色以及大量删减,尽量减少到4000-5000字左右:
问:因为杭州的公司刚刚上市,然后股价也不是很稳定,当然上市的当天还比较强,现在市场上是认为它泡沫比较大,但另一方面,大家就觉得这个行业非常有前途,两位都是这个行业的从业者,我就想问一下这个行业到底是泡沫大,还是说机会多?
许华哲(破壳机器人创始人):我觉得首先机会多的地方泡沫一定大,对吧?大家觉得这种机会多,热钱涌入,人才涌入,一定会有一个非常高的预期,而且这个预期往往是高于此时此刻的状态。
但是当大家谈泡沫的时候,什么是泡沫?泡沫是预期在这儿,然后实际在这儿,然后中间的差距。我觉得大家说的泡沫是一个真空层,但如果我们这个地方追的速度足够快,能追得上上面的大家的预期,我觉得这个泡沫相当于就填实了,那这样子就完成了。
我觉得刚才您提到比如说上半年,当然我不知道这个数据是否准确,但是说是有460亿的资金投入,那是刚投进去对吧?任何事物都要有发展的,并不是说它投进去我立刻就变强了,如果是这样的话,银行应该是最强的。
所以它投进来,我们要慢慢的把资金整个行业去把它分解掉,分解的过程是在做研发。我觉得我的预计一直很乐观,我觉得2到3年后泡泡是会被我们的整体实力追上。
比如说现在有没有泡沫?一定是存在的,但是我对具身智能整体的发展是非常乐观的,因为它是一个很实在的东西,它跟过去的可能您在科技行业也有一些别的泡沫不一样,它里面没有实质性技术进展、没有实质性技术变化的那些行业不一样,泡沫是永远存在的,然后慢慢它就炸了。
但具身智能因为目前已经看到了智能上面的上限不停的在变化、不停的在突破,所以具身智能我认为这个发展一定会达到大家的预期的,这是我的观点。
韩铮(苏度科技联合创始人、CEO):我觉得许老师说的已经很好。我觉得是因为第一家上市的公司毕竟承载了大家对于整个行业的所有的希望,但是它毕竟各自擅长的领域是有区别的。
比如,今天我跟许老师包括台上的另外两家公司,我们在做交流的时候,其实这几家公司都是做物理操作,就是我们想的是怎么把物理操作任务完成的更好。但是有的公司其实更擅长的是做这种运动本体的这种控制。
那么公众来说,对于一开始上市的第一家公司,承载的希望是希望把我们大家都在共同努力的各种各样的任务都完成,那肯定会早期的话会有一点点预期上的偏差。但随着这个市场对于各家公司的擅长的领域,包括市场的判断有更多的了解信息之后,我觉得还是会回归到一个合理的市场的区间的价格。
但物理操作的话更难一些。同时在做本体控制运控的领域里面,不管是说刚才说的数据就是专业数据也好,仿真也好,仿真在那边的话已经被充分验证过了,只不过这边就复杂一些,然后可能需要跟各种各样的方法组合在一起。当然大家对于机器人的期待,我觉得是整个行业一起去完成。
问:对于高估和低估模型规模的事,能否进一步解释一下?
许华哲:我觉得是大家对数字具身智能数据的数字的追求被高估了,或者说这个东西的重要性被高估了。
大家今天为什么追求这个数字,我也非常能理解,因为它是非常显化的、非常可比较的,无论是创业者本身还是外界的媒体、投资人,当去跟你聊的时候,你很容易说我有100万小时数据,所以我就比有10万小时数据的那个人多了一个量级,但是这件事本身确实是最容易可比较的东西。但是我们最近看到发布的几个模型里面,并没有看到说这个数字越高,效果就一定越好。
当然,我是非常相信数据这件事本身的,就是说数据一定要往上涨,但是不是盲目的,我只为了那个数字,然后放弃里面的质量的要求,放弃里面的找好数据的时间,因为你去扩数据量是很容易的一件事。
市面上有很多卖数据的,你自己可以随时组建大规模的人力团队去采集,但是去比这个东西除了对资源的浪费没有什么太多的好处。这个时候我们是不是应该边找边扩,找到了我再往上扩,而不是说我们先扩上去先不管,这样其实造成非常大的一个浪费。
因为一个小时的数据市面上可能是卖几百块人民币,比如说100万小时可能就是几个亿的这样一个量级,那几个亿这样的一个量级我就扔出去了,如果最后证明这个数据没用,对这个公司来讲,对所有干活的采集的人来讲,对整个社会来讲都是巨大的浪费。所以这是我为什么觉得对这个数字的追求被严重高估。
问:你评估下来大概有多少数据是被浪费掉的?
许华哲:这个我没有确切数字,因为这个数据在这个社会上是分布式的,可能卖数据的公司至少都有几十家,所以我并不能知道它到底有多少被浪费掉,但一定存在浪费。
问:苏度走的更多是一个仿真数据路线,但同类公司也在加入一些本体的数据,您怎么看不同的数据类型,未来可能是一个什么样的形式?我们会一直走仿真路线,还是未来也会考虑不同的数据类型?
韩铮:我其实顺着许老师刚才的话,核心表达的意思就是,结构化、多样性、高质量的数据,如果是要做技术模型的话,这三点其实都绕不过去。
我觉得自动驾驶有一点点类似,至少要有人采集大量的这种不太结构化的数据,但是它的多样性首先要有。比如说后面再做自动驾驶的时候,对于什么是高质量和多样性,其实就有更好的理解,其实就可以用更少量的、更高质量的,但是分布更广的数据和高质量的数据当中去做训练,这其实在自动驾驶已经体现了,我觉得机器人也会有类似。
我们用的思路之所以用仿真,我觉得两点:在开源阶段,就是大家都在做开源的阶段,我觉得是一个科研阶段,其实并不是一个做大规模预训练的方式和方法,但是那个思想是类似有相关性的。
那个时候包括今天蚂蚁灵波的沈总也提到,就是说我们去仿真很多的传感器,包括它的核心组件,然后比如说像触觉,有这种柔性的仿真的,的确以前的仿真器在噪声方面有不足,但是在仿真器里边,从2024年夏天之前我们开始做大规模的开源,到现在开源和一元并行必然版本当中,其实已经能看到完全不太一样的效果,所以他刚才提到的一些问题其实都是要做系统化工程里面他们要去解决的。
但我们也想再澄清一下,我们是以仿真数据为核心的一部分,有些任务是纯仿真,迁移到真机上面来,其实就可以达到更好的效果。但是有些任务,比如说在7月世界人工智能大会时候展示的很多任务,其实许老师我们也有些交流,有些的话其实我们就用了一些真实世界数据,包括像遥操,然后包括各种各样的动物,然后包括第一人称视角、第三人称视角的数据,在预训练和后训练里面都要用到,但是它的用法可能跟大家现在讲的真实世界的各种各样的数据加上仿真使用的方法会完全不同,判断不太一样。
但还是回到刚才一开始我们讲的,大规模、结构化、高质量的数据一定要全。那么在这一点上,我们认为仿真的会起到非常重要的作用,而且我们其实看到一些比较好的结果。接下来我们的任务就是把这些结果带到更多人的面前,让大家可以去体验一下,同时大家也会给我们提新的要求。
我举两个小的例子。我们在4月份在官网上发布的2万的版本,如果是对于通用的刚性的物体或者带有一定柔性的物体去做通用的抓的动作,就pick的这个动作的话,是几乎不需要真实数据的,即便是对于一些柔性的物体,这个其实也还好,几乎不需要补真机的遥操数据,当然预训练的话我们几乎就没有用到真实数据。
但是我们在7月份展示的有两种任务,第一比如说我们在做工业生产的时候,比如说电池的组装,那么它的几个步骤,比如说第一步你应该去拿什么箱体,第二类的话就拿电芯,第三步的话应该去做接插,同时你还要遵守一定的规则,这些其实都是要人工去给演示和示教的,这些是要有的,因为它必须要遵守一定的逻辑和规则,靠仿真应该是不太行。
另外,比如说对于柔性物体的操作,比如说大家都在叠衣服,我们最近其实大家有些质疑,那么在对于通用的这种柔性的布料的处理,和比如说我们做更长程的一些任务,把一些东西包在布里面,那么这些怎么去折叠的话,其实也是由人去告诉他。
比如说。我要折叠一个手帕,把这个东西当中打成一个包装,的确是用真实世界的数据当中给他一些示教,但是怎么去拿布角,包括拿这个东西放到哪个位置的话,这是我们基于仿真为预训练为主的这种方式,已经可以达到非常稳定可靠的效果,而且放这个物体在暗环境、暗光照的话其实也表现非常好,所以几乎不太需要真实数据。
问:如何看待仿真的成本问题。放长远来看的话,就是这些非真机数据它在长期来看的话,有没有一些谁会先走到一个瓶颈?苏度有没有一个长远或是探索出它边界的可能性。
韩铮:我首先回答一下,就是说仿真的数据包括100万亿美金。说我们自己的计算的话应该是10万亿美金,然后英伟达当时黄仁勋的当时分析接受采访的时候提过100万亿美金的计算。
我觉得比较简单,而且我觉得其实与许老师刚才说的其实并不矛盾,如果你做某一类的任务,然后需要的产品化的数据的话,可能并不需要半个小时以上,就可以达到一个可能。
那100万小时,假如说它的质量和分布的话都不是特别好,其实用处不大。但是如果你能挑出来分布质量都比较好的数据的话,可能做那一类的任务的话其实就落地了。
这的确是,但是我们讲的后面那一步的话,实际上是更多的在各种各样的任务。我们讲的泛化的话,我们先分4个维度,就是物体级的泛化,环境级的泛化,任务级的泛化和跨问题的方法,我觉得我们可能首先放弃的就是跨问题方法。然后再看前面那三种,我们先去处理的是前面技能层面的,对于抓不一样的物体,拿不一样的物体放不一样的物体,拧不一样的瓶盖都可以做得了,然后在不一样的房间里面,但是让我们去做完后落户的话,暂时这个得看,这个需要时间。
但对于我们的要求的话,是对所有的瓶子,所有的类似的物体的话都能抓得起来。同时我们在7月份也展示了,除了单手的去抓以外的话,它的放包括特别是一些精密的插和组装的任务的话,其实也有很强的这种泛化。那么对于任意一组的a和b,它假如是一段比如说做接插类的物体的话,其实在7月份我们给了一些新技能,抓放插的这些个包括一些做折叠的动作的话,其实泛化性完全会非常好。
其实也是仿真里面大家的一些质疑,我觉得我们公司希望达到的一种效果,大家觉得仿真完全做不了,不管是今天陈总说的什么标志性,就让中间的哪个环节嫁接不了,我们先尝试解决整个架构上面当中还是可行的。然后大家说只能做抓。
再给我们3到6个月的时间,我们会给大家看其他情形。
同时也有人说我们做不了长程的技能,那么我们其实给大家看这个组合的各种各样的成熟技能,包括比如说我们做的电池组装线,其实我们有4到5台机器人,然后一共做7到10个任务,也可以连续的运营当中的话非常多个小时,然后在上个月的活动上,应该是全场里面的我们机器人的话是连续输出时间最长的,就是完成任务时间最长的。
但还是回过头来讲,VLA和上层的这些动态理解的话,我觉得其实是整个行业当中还要共同去研究的。我们首先希望底层技术操作技能能够达到稳定可靠,这个可能会两种路线当中会有一些结果的方法。
我觉得接下来的话,整个行业的话其实还有很多工作要做。
问:一、二等几个梯队,到底差距有多大?
许华哲:我觉得首先要看怎么看梯队,对吧?
我觉得梯队是怎么理解的。如果是看估值当然是有梯队,因为它是一个绝对数字,但是是否估值高意味着能赢,是否估值高意味着能做成这件事儿,我觉得倒未必。
原因是还是我逻辑就是说,具身智能的发展它不是单纯砸资源,它是需要大量的资源,但是你也需要探索出正确的路,然后往那条正确的路上疯狂的去追资源才可以成功。
所以现在有相当一部分的公司是我有很多资源,但是我没有找到那个路,资源在那也是等待那条路的出现。所以从这个角度上来说,单纯看估值的梯队划分,我觉得也是一种合理的划分,但是我觉得不是唯一合理的划分。
我觉得最终要决胜的或者最终看谁是第一梯队,谁是第二梯队,我觉得看智能的能力和整机的稳定性,这两件事:他能不能在那干一个月一次不坏,或者甚至干一年一次不坏,且它的模型是不是扔在任何地方拿过来就能用?我觉得这两件事谁做的最好,谁就是第一。
最后提醒一下,明天会把下半场采访和内容整理一下,还有蚂蚁灵波的最新消息,明天见。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.