网易首页 > 网易号 > 正文 申请入驻

机器人如何自进化,乐享科技走了一条新路

0
分享至


当数字世界的 AI 开始讨论自进化,物理世界的 AI 有没有自进化,或许是下一个时代最重要的问题。

作者|Li Yuan

编辑|郑玄

最近,乐享科技因为一个颇大胆的 claim,引发了不少关注:它提出,其具身智能模型以太大模型能够在部署和执行过程中持续更新,并将这种能力概括为「自进化」,是全球首个能自进化的具身智能模型。

自进化是一个容易引起争议的说法。「进化」究竟是模型参数发生了变化,还是进行了任务的临时调整?在多大程度上这样的调整能够变成可迁移的新能力?一个模型能够适配不同场景和不同身体,又应该被理解为工程层面的泛化,还是更强意义上的持续成长?在机器人行业仍然需要解决稳定执行问题的阶段,「自进化」显然是一个需要被谨慎对待的判断。

近日,乐享科技又进行了一场户外直播。按照直播前公布的目标,搭载 Aether 以太大模型的机器人要在户外接受随机点单,完成包括食材和工具处理、烤制、翻面、上菜在内的烧烤任务,并应对临时打断、需求临时增加和场景变化。

在现场超 30 位专业媒体和线上超 550 万观众的见证下,实际呈现的过程并非每一步都顺利。

机器人完成了部分自主烧烤操作,也出现了停顿、失败和重新调整。乐享科技似乎并不回避这些不完美:它想展示的重点,不是机器人在一个固定流程里零失误地把烧烤做完,而是任务和环境发生变化之后,机器人能否继续寻找信息、调整动作,再把任务推进下去。两个机器人本体全程互相传递任务信息、自主思考决策并合理分工协作。


一场直播当然不能回答关于「自进化」的所有问题,但这种展示方式至少体现出一种相对开放的态度:机器人可以失败,真正需要观察的是失败之后会发生什么。

对机器人来说,「自进化」不能只是一个好听的词。它至少要回答三个问题:第一,机器人能不能发现现实和自己预测之间的偏差;第二,它能不能判断哪些经验值得留下、哪些应该忘掉;第三,它能不能把一次任务、一个场景和一具身体上的经验,迁移到新的任务、场景和身体上。

当数字世界的 AI 开始讨论自进化,物理世界的 AI 有没有自进化,或许是下一个时代最重要的问题。

为此,我们和乐享科技背后的团队聊了聊他们的模型思路。

01

不是更会模仿,

而是能不能理解真实世界

过去几年,具身智能最常见的思路,是把视觉、语言和动作连接起来:机器人看到环境,接收任务,再输出动作。这条路线的价值很直接,它让机器人可以借助大规模数据学习人的示范,也让复杂指令开始有机会落到具体行动上。

但在乐享科技团队看来,这种从输入到动作的映射仍然存在一个根本限制:它擅长回答「下一步应该做什么」,却未必真正理解「为什么要这样做」,以及这个动作会给真实世界带来什么后果。

团队将 VLA 的局限概括为「不懂因果」,将传统 world model 的问题概括为「可生成、不可执行」。按照这一判断,前者更接近从已有数据中学习动作规律,但这并不自然等于理解动作与结果之间的因果关系;后者可以预测世界可能如何变化,却不代表预测出的未来一定能够被机器人的关节、力矩和控制系统实现。


真实世界恰恰不是一组干净的输入输出。接触力、摩擦、滑动、遮挡、物体形变以及目标临时变化,都会让同一个动作产生不同后果。一个杯子的质量增加一倍,关节需要输出的力矩就应该随之变化;液体重心不断移动,机器人也不能只是机械复现某条既定轨迹。画面上「看起来合理」,与身体上「真的做得到」之间,还有很长一段距离。

这解释了乐享科技为什么没有把重点继续放在动作预测上。

按照团队在采访中的描述,以太大模型是一个由世界状态、内部状态和能量状态耦合而成的动力系统。感知、预测和行动仍然存在,但并不是三个依次调用的独立模块,也不是一个从输入直接吐出动作的黑盒。团队更愿意把它称为「energy-driven state transition」,即由能量驱动的状态转移。

这里的「能量」不是机器人电池还剩多少,相关负责人把它形容为一个 landscape,一张贯穿系统的评价地形:哪些状态值得靠近,哪些状态应该舍弃,当前还缺少什么信息,以及接下来应该把计算和注意力放在哪里,都在这张地形中被共同衡量。

这让感知本身也变成了任务的一部分。机器人不再只是被动接收摄像头传回来的画面,而是带着问题寻找答案:为了继续行动,我还需要看到什么?当前视角能否消除不确定性?是否应该先移动身体、改变观察位置,再决定下一步动作?团队将其称为具有「感知意图」的主动感知。

这套思路可以从乐享科技展示的「太极宗师」任务中得到更直观的理解。在这一任务里,机器人左手需要控制杯中液体不洒,右手同时维持另一个物体稳定。液体状态、外部扰动和关节状态都在持续变化,很难依靠一条固定动作轨迹完成。按照团队的解释,系统需要建立动作、物理状态与结果之间的因果关系,并根据后果不断调节控制。

这并不能单独证明机器人已经拥有完整的物理直觉,但它至少揭示了乐享科技想用以太大模型解决的问题:真正困难的不是生成下一个看起来正确的动作,而是让动作在一个不断变化、会反过来影响机器人的物理世界里成立。

从模仿动作走向理解行动后果,是这条路线的第一层变化。它也为「自进化」提供了前提:如果机器人无法识别现实与预测的差异,就无从知道自己错在哪里,更谈不上从错误中形成新能力。

02

自进化不是一句口号,

而是一套闭环机制

那么,乐享科技为什么认为 Aether 可以「自进化」?在采访中,我们把问题进一步落到了模型内部:机器人执行任务时,变化的究竟只是瞬时状态和记忆,还是策略乃至模型权重?

乐享科技给出的回答是,这些层级都会更新。按照团队的解释,他们所说的「自进化」,首先发生在执行过程中的预测误差修正,但并不止于一次性的状态调整。

机器人在行动前形成预测,执行后观察结果,再比较真实结果与原有预测之间的偏差。如果世界已经不再是刚才以为的样子,系统就需要更新内部状态,判断原计划是否失效,再进行局部或全局的重新规划。这个过程不是任务失败后才启动的补救措施,而是伴随每一次行动持续发生。

面对临时改变的目标,系统会重新判断原有计划是否仍然适用,并生成新的动作:「我现在看到的世界,还是我刚才认为的世界吗?」从预测、执行、反馈、更新到再次行动,系统始终处在循环之中。

在 demo 中,机器人需要处理一块有污渍的玻璃。它发现污渍并不在自己面对的这一侧,而在玻璃外侧,于是改变原来的处理方式,把手伸向窗外继续擦拭。正是体现这一点。

这与传统意义上的 action prediction 有一个明显区别。后者更关心在当前输入下输出什么动作;按照乐享科技的说法,Aether 则会同时维护世界状态、任务状态和系统自身状态。一次行动之后,变化的不只是机械臂的位置,也可能包括短期经验、技能参数,以及系统对某种因果规律的判断。


长时序任务由此成为一个重要观察点。团队提到,乐享科技已经展示过一镜到底的连续任务,机器人需要理解步骤之间的先后关系,记住已经完成到哪里,并能在中途改变目标或中断后继续执行。单个动作是否准确当然重要,但更难的是,在持续变化的过程中保持对「当前世界是什么样」「任务进行到哪里」「下一步为什么这样做」的统一理解。

只是,能够根据反馈调整,还不等于能够持续学习。在线学习最大的风险,是把偶然扰动当成规律,把错误经验写进模型,甚至在学会新东西时破坏原有能力。

按照乐享科技的介绍,以太大模型不会让所有新经验直接进入长期知识。系统会先评估一次经验是否可靠、是否新颖、能否归因、能否泛化,再决定它值不值得改变已有知识。换句话说,学习能力的一半,是知道什么应该学;另一半,是知道什么不该学。

与之配套的是分层记忆。越具体、越依赖单一场景的状态,生命周期越短,任务结束后就可以被清除;越抽象、经过反复验证的规律,保留时间越长,可能进入世界模型和因果模型。


模型是否真的会「调参」,是区分临场适应与自进化的关键。对此,团队明确表示,经过筛选和验证的经验也可能进一步影响模型权重,并被长期保留;如果只是某个场景下的临时状态,则不会永久写入模型。也正因为更新可能从记忆和策略继续进入参数层,乐享科技才把这套机制称为「自进化」。不过,这里仍然需要保留一个边界:目前我们得到的是团队对内部机制的解释,权重如何变化、变化幅度多大,以及新能力能否稳定保留,还需要更具体的测试结果来呈现。

数据的角色也因此发生变化。真人视频被用于理解人的行为逻辑、推测意图和构建认知,类似一种预训练;示教视频负责把认知落到可执行动作上,被团队形容为「给机器人上幼儿园」;真实运行数据使用得最少,却承担最重要的 reality calibration,也就是让机器人在真实环境里接受检验。

团队还有一个更形象的说法:机器人可以给自己做「错题本」。真正有价值的不是记住某一次失败,而是从失败中分离出可以复用的规律,在下一次面对相似但并不完全相同的任务时调用它。

这也解释了为什么泛化性是判断自进化是否成立的关键。如果所谓学习只能留在原来的任务和原来的机器人上,它更像一次局部调参;只有当经验能够穿过场景和本体差异,才可能真正成为更一般的能力。


据相关负责人介绍,以太大模型已经在约五家不同机器人本体上积累经验,涉及双臂、双足和轮式形态。不同本体在关节数量、自由度、末端执行器、质量分布、控制方式以及传感器布局上都有差异。迁移到新机器人时,团队通常希望获得 URDF、关节名称和传感器配置,以完成运动学对齐、传感器标定、动力学参数辨识和进一步微调。

以太大模型之所以能真正实现「一脑多形」,关键在于:接入一个全新本体后,它能够通过自主探索认知该本体的性能差异、关节限位等约束,并据此生成适配不同本体的动作与轨迹来完成任务。由此,模型完成了对本体的自我认知与适配,进而实现软硬件解耦。

控制系统同样体现了这种分工。团队所称的 200Hz 以上频率,覆盖的是状态读取、控制器计算和关节指令更新;高层感知和推理并不以同一个固定频率运行,而是根据任务复杂度与当前不确定性调整周期。当高层推理需要更长时间时,主动感知反而可能变得更频繁,以获得更多信息。

因此,乐享科技所说的自进化,并不是机器人突然拥有了自我意识,也不是一个简单的端到端黑盒,而是一组更综合的工程机制:主动获取信息,根据预测误差调整行动,筛选值得学习的经验,把不同层级的经验存入不同记忆,再尝试将较稳定的规律迁移到新任务和新身体上。

03

如果机器人真的能自进化,

那就是 next level

过去的机器人更像被训练好的执行机器。它可以把规定动作做得越来越精准,但任务之外的经验很难沉淀;它可以被部署到现场,部署后的反馈却未必会变成长期能力;它也可以更换场景和身体,但每一次迁移常常近似重新开始。

乐享科技借以太大模型所提出的观点,不只是让机器人完成更多工作,而是让部署本身成为学习过程。机器人进入真实世界之后,不再只是消耗训练阶段获得的能力,也可能在一次次行动中校准对世界的理解,把可验证的经验逐渐变成新的能力。

最近围绕 GPT-6 的讨论,也让许多人重新思考下一代模型的跃迁会来自哪里。人们关心的已不只是参数是否更大、推理是否更强,还包括模型能否在更长周期中积累经验、形成记忆,并在持续交互中改变自己的能力边界。落到机器人身上,这个问题会变得更具体,也更严格,因为每一个判断最终都要接受物理世界的检验。

如果具身智能只是从指令走向动作,它仍然是一种更复杂的自动化。但如果机器人能够在行动中发现偏差,在反馈中筛选经验,在记忆中沉淀规律,并把这些规律带到新的任务和身体上,那么它就不只是「更会干活」,而是开始具备某种生长性。

当然,关于「自进化」,乐享科技需要回答的还有很多:泛化能够跨越多大的任务差异,学习可以持续多久,模型变化如何被量化,新能力能否在不同机器人上稳定复现,以及长期运行后如何证明旧能力没有退化。

但目前所展示出的能力已经把问题向前推了一步。衡量机器人的方式,或许将不再只有「它现在会做什么」,还要加上一句:「它做完之后学会了什么?」

一旦机器人真的能够把现实世界里的经历变成可积累、可验证、可迁移的能力,它改变的就不只是某个 demo、某家公司或某条技术路线。那意味着机器人不再只是被制造、被训练、被部署的机器,而可能成为一种能够在世界中持续获得经验的行动系统。

那确实是具身智能真正的 next level。

*头图来源:乐享科技

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问

你认为下一代模型的跃迁会来自哪里?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一场席卷全国的全民消费大觉醒彻底爆发。

一场席卷全国的全民消费大觉醒彻底爆发。

流苏晚晴
2026-10-05 21:50:24
俄军第11坦克团第五任团长被击毙!“新俄罗斯”公路变“死亡之路”

俄军第11坦克团第五任团长被击毙!“新俄罗斯”公路变“死亡之路”

鹰眼Defence
2026-10-06 16:56:27
我的身材这么好,之前的你还会喜欢吗?

我的身材这么好,之前的你还会喜欢吗?

疾跑的小蜗牛
2026-10-05 17:20:30
今日重要赛事!10月6日,央视CCTV5、CCTV5+直播节目表

今日重要赛事!10月6日,央视CCTV5、CCTV5+直播节目表

薇说体育
2026-10-06 10:30:59
中网女单八强诞生2席,世界第6爆冷出局,小安娃轻松晋级

中网女单八强诞生2席,世界第6爆冷出局,小安娃轻松晋级

刘笤说体坛
2026-10-06 15:13:41
白应苍临刑前自曝电诈内幕:随口一个资金盘20亿

白应苍临刑前自曝电诈内幕:随口一个资金盘20亿

看看新闻Knews
2026-10-06 17:45:02
不允许网约车司机收返程费,但官方那句理由,把责任指向了平台

不允许网约车司机收返程费,但官方那句理由,把责任指向了平台

呼呼历史论
2026-10-06 11:52:15
1998年,遭遇不公,刘欢生气的说:我再也不参加所谓的排行榜了

1998年,遭遇不公,刘欢生气的说:我再也不参加所谓的排行榜了

手工制作阿歼
2026-10-05 15:24:32
5天8亿,再体面的撤档声明也掩饰不了这个国庆档的票房冷淡

5天8亿,再体面的撤档声明也掩饰不了这个国庆档的票房冷淡

情感大头说说
2026-10-06 02:28:47
站台台独分子惹怒亿万网友,蔡康永最新16字回应,依然充满文青式矫情

站台台独分子惹怒亿万网友,蔡康永最新16字回应,依然充满文青式矫情

无情有思ss
2026-10-06 10:09:31
中网16强决出八席:大满贯女单冠军被淘汰,郑钦文赛程公布

中网16强决出八席:大满贯女单冠军被淘汰,郑钦文赛程公布

刘哥谈体育
2026-10-06 12:26:45
大S 50岁冥诞这天,娱乐圈的人情冷暖,在她身上体现的淋漓尽致

大S 50岁冥诞这天,娱乐圈的人情冷暖,在她身上体现的淋漓尽致

寒士之言本尊
2026-10-06 15:07:17
官方说死了9个人,幸存者说至少三千,那列装满尸体的火车,开了两百节车厢,一路开进了《百年孤独》

官方说死了9个人,幸存者说至少三千,那列装满尸体的火车,开了两百节车厢,一路开进了《百年孤独》

古代经典
2026-09-17 12:10:18
23分钟砍14+12,中锋韦尔或被交易,火箭迎来补强机会

23分钟砍14+12,中锋韦尔或被交易,火箭迎来补强机会

激情与荣耀并存
2026-10-06 14:57:02
婆婆宣布28万聘礼给2000,我妈接过话筒:730万大平层不再是嫁妆

婆婆宣布28万聘礼给2000,我妈接过话筒:730万大平层不再是嫁妆

枫红染山径
2026-10-06 13:39:42
江苏著名画家王飞飞在宁逝世

江苏著名画家王飞飞在宁逝世

现代快报
2026-10-05 23:06:24
世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

福建睿平
2026-08-28 07:25:16
佤军副总司令被抓获对佤邦的影响

佤军副总司令被抓获对佤邦的影响

水泥土的搞笑
2026-10-06 03:25:34
直播带货开始被清算了!

直播带货开始被清算了!

职场资深秘书
2026-10-05 11:34:37
对越反击战,各国在联合国威胁中国撤军,李先念:不达目的不撤军

对越反击战,各国在联合国威胁中国撤军,李先念:不达目的不撤军

纪史行者
2026-09-27 07:05:06
2026-10-06 18:16:49
极客公园
极客公园
让最棒的创新成为头条
12878文章数 78948关注度
往期回顾 全部

科技要闻

光遗传学是什么,为什么这项发现如此重要

头条要闻

贵州女子五天爬完五岳 当事人:耗时最长的是华山

头条要闻

贵州女子五天爬完五岳 当事人:耗时最长的是华山

体育要闻

30天30队·雄鹿:没有扬尼斯,重新试错吧

娱乐要闻

身家千万独居的王曼昱,私底下有多壕

财经要闻

杨植麟断腕:Kimi的至暗时刻与远征

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

房产
数码
本地
游戏
亲子

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

数码要闻

12GB显存显卡跑125B模型:Strata登场

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

龙与地下城新游《术士》缩小开放世界 减少手把手引导

亲子要闻

兄妹俩好的时候穿一条裤子,吵架的时候也是真闹腾

无障碍浏览 进入关怀版