![]()
具身智能的下一轮竞争,是机器人技能量产。
作者 | 许丽思
编辑 | 漠影
走进2026WRC展馆,最直观的感受是:机器人的上岗速度,比预想中快了太多!
物料搬运、货物分拣、零部件装配等各种任务轮番登场,以常见的家庭杂物收纳为例,机器人先听懂指令,转头寻找目标,再伸手依次将杂物收纳至指定位置。现场有人挪动物体,它还要重新定位,及时调整动作。
这套演示通常仅有短短几分钟,但机器人背后的准备链路十分漫长。
机器人需要经历数据采集与处理、模型训练、仿真验证和真机部署等环节,任何一环卡住,展台上的流畅动作都可能变成抓空、停顿甚至碰撞。
我们走访了WRC现场多家具身智能企业,试图沿着一项机器人技能的形成过程继续向下追问:
训练所需的数据从哪里来?复杂的具身模型在哪里训练?仿真测试和模型迭代怎样进一步提速?模型装进机器人之后,能不能真正做到边看、边想、边行动?当数十台、数百台机器人投入使用,交互、安全和日常运营又该如何保障?
这些企业的机器人形态不同,瞄准的场景也相差很远。但一个名字开始在采访中反复出现——百度智能云。
根据Omdia和IDC的报告,百度智能云的市场份额位居中国具身智能AI云市场第一。
一个更值得追问的问题也随之出现:在具身智能刚刚进入落地探索阶段、产业格局尚未定型的爆发前夜,这个第一到底是如何炼成的?
01.
机器人进入真实世界,要翻过三座山
IDC数据显示,2025年全球人形机器人出货量超过1.8万台,中国企业占据主导地位。前阵子,宇树公开提到,其人形机器人已经累计生产下线18000台;今年6月,智元宣布已经累计下线15000台具身智能机器人。
这些数字释放出一个清晰信号:人形机器人已经告别小批量试制阶段,头部企业的供应链、生产线和交付体系正在加速运转。
然而,产量爬坡只是第一步。IDC同时提到,2025年,超过85%的人形机器人仍部署在表演、教育、数据采集和导览服务等场景;制造与物流领域虽然已经出现试点,整体还处于早期验证阶段。
这组反差,揭示了具身智能产业眼下最容易被忽略的问题:人形机器人正在被批量造出来,但本体量产并不等于能力量产。每台机器人会多少种工作、多久能学会一项新技能、能否在真实现场稳定执行,仍取决于背后的数据、模型和工程体系。
具身智能的下一轮竞争,不只是机器人量产,更是机器人技能量产。沿着一项技能的生产过程继续向下看,行业还要翻过本体、数据和模型三座山。
![]()
1、本体:造出来之后,还要听得懂、管得住
进入嘈杂的商场和工厂,机器人能不能从人声与机器声中听清远处的指令?面对不同用户的表达方式,它能不能准确理解意图并把动作做到位?机器人投入使用后,安全、适配和日常运营又该怎样解决?
机器人数量增加后,安全问题也会被放大。攻击者可能通过漏洞远程控制机器人,或者借助数据投毒、智能体欺骗诱导机器人做出异常行为。
目前,大量机器人企业资源仍集中在功能研发上,安全意识、安全团队和标准体系建设都还处在补课阶段,投入大量资源训练模型,一旦被窃取,可能造成核心竞争力流失。
2、数据:缺的不只是数量,更是可训练的数据
在WRC现场,数据不够,是多家具身智能行业厂商不断强化的共识。围绕真机采集、遥操作等路线,大量企业涌入,争夺机器人时代的经验生产能力。
但是,真实机器人数据采集成本高、周期长,还很难同时兼顾规模、质量和场景丰富度。尤其是复杂操作和长尾场景,真实数据更加稀缺。
采集完成也不等于可以直接训练。不同采集方式产生的视频、时间戳、动作轨迹和传感器数据格式并不统一,还要经过清洗、切片、标注、质量筛选和语义对齐,才能转化为训练样本。
行业真正缺少的,已经不只是更多采集设备,还有一套将多源原始数据稳定转化为训练资产的工程体系。
3、模型:既要理解世界,也要跟得上真实世界
不同于大语言模型只需要预测下一个token,具身模型要进一步预测动作将怎样改变物理世界,必须理解重力、摩擦、形变、光照及其复杂组合关系,训练难度远高于大语言模型。
训练完成只是起点。机器人在现场还必须边看、边判断、边行动。一次推理延迟,可能让机械臂错过抓取位置,也可能让机器人来不及避开突然出现的人。模型规模和数据量持续增长,又进一步抬高了训练吞吐、多机扩展和推理速度的要求。
真机测试成本高、风险大,仿真能够让机器人提前试错,但Isaac Sim、RLinf、ManiSkill等工具配置复杂,环境和资产加载也会拖慢迭代速度。很多时候,实验还没开始,工程师已经在环境搭建和软硬件适配上消耗了大量精力。
本体、数据和模型看似是三类问题,背后其实指向同一个闭环:机器人执行任务产生数据,数据推动模型训练,模型再部署回机器人,新的执行结果继续回流。任何一环没有打通,企业都可能陷入重复采集、训练和适配。
因此,行业更深层的缺口,是一套连接数据生产、模型训练、仿真评测和推理部署的AI基础设施,让机器人技能能够被持续生产、验证和迭代。
02.
百度智能云,具身智能企业的共同选择
百度智能云服务具身智能企业,核心产品是百度百舸AI计算平台,正在把数据生产、模型训练、仿真评测和推理部署连接成一条机器人技能生产线。
沿着这条链路继续追溯,可以看到百度在自动驾驶、大模型和云计算领域积累的能力,都在具身智能汇合。
1、数据:从自动驾驶走向具身智能
机器人学习一项技能,首先需要获得海量操作经验。百度在自动驾驶领域长期处理真实道路数据,积累了大规模采集、标注、处理和长尾场景挖掘能力,如今正在把这样的能力迁移到具身智能。
目前,百度已经在大湾区建设了首个专注具身智能的实体数据基地。基地采用“真实场景+虚实融合”的模式,一期覆盖桌面操作、工业制造及物流、商超零售等作业空间,能够采集毫米级精细操作和长序列复杂任务数据。
据了解,其AI数据服务已经向多家具身厂商交付百人规模的数据标注项目,同等规模项目可帮助企业节省约20%的成本,并缩短响应周期。
数据采回来,还要经过清洗、标注、分析和质量评估,才能真正用于模型训练。百度百舸6.0预置多个主流高质量数据集、Nvidia Isaac 生态工具,内置丰富数据处理算子,开箱即用。
百度百舸6.0还兼容主流算法框架,无需开发者从零搭建数据处理体系。还能提供多模态数据深度清洗、精准标注、多维分析与质量评估,实现一站式全链路数据处理能力。
对客户而言,同样的数据预算可以覆盖更多样本和场景,模型训练也能更早启动。
2、仿真:让机器人先在虚拟世界快速试错
高保真仿真是规模化训练的必经之路,能够让机器人在较低成本和低风险的情况下完成大规模训练与测试,提前发现模型在极端情况、复杂干扰下可能暴露的问题。
百度百舸6.0预置Isaac、ManiSkill3等主流仿真引擎,并提供环境管理与适配能力,减少重复部署和调试。平台还会优化机器人模型、场景和任务资产的加载速度,缩短启动时间,提高多个仿真任务同时运行的效率和仿真FPS。
这样的话,工程师就可以在同样的时间和算力预算下,跑更多轮实验,更快发现模型存在的问题,把精力更多放在算法和任务设计上。
3、训练:把模型训练从“能跑”变成“高效跑”
以NVIDIA开源的世界模型Cosmos 3为例,百度百舸在不依赖NVLink、HPN等高端专用互联的国内主流GPU上,完成了一轮系统性的AI Infra工程优化。
单机层面,通过重构数据加载、编译适配与显存策略,训练效率提升近一倍,算力利用率超过官方旗舰平台的公开基准。集群层面,训练规模扩展到512卡,扩展效率保持在97%以上。
系统层面,百度百舸将视频编码等前置计算从训练节点解耦,交由成本更低的算力承接,让训练卡专注训练,最终以约 1.5 倍的硬件投入换来2.1倍的整体吞吐,相当于同样预算多获得约35%的训练算力。
目前百度百舸已面向具身智能场景,交付OpenPI、GR00T N1.6等数十个模型的训推加速成果。
4、推理:让机器人“慢思考、快执行”
在推理环节,机器人需要持续接收视觉、语言、力觉等信息,快速完成理解、决策和动作输出,形成连续的物理交互闭环。
过去,很多模型会把机器人的“规划”和“执行”绑在一起:机器人每执行一步,都要等待完整计算结束,动作频率容易被最慢的规划模块拖住。
上海交大就选择将复杂规划与高频执行解耦:世界规划模块在后台“慢思考”,动作模块在前台“快反应”。
今年6月,上海交通大学ScaleLab团队、上海人工智能实验室与百度百舸共同推出了AHA-WAM(异步视野自适应世界-动作模型)。这个异步架构将耗时的视觉场景分析移出动作执行核心链路,使得单步动作推理延迟由415毫秒降至41毫秒,闭环控制频率由同类模型的5.26Hz提升至24.17Hz;轻量化版本AHA-WAM-Flash进一步达到56.95Hz。
延迟从415毫秒降至41毫秒,能够让机器人每执行一步时,都能更及时地使用最新观测修正动作。物体被移动或环境突然变化后,它也有更大机会及时反应,连续操作由此更加流畅。
5、本体:让机器人更好地与人、环境打交道
数据、训练、仿真和推理让机器人逐步掌握了技能,而交互、安全和批量运营则决定了这些技能能否稳定地进入真实场景。
在交互层面,百度为本体企业提供了远场多模态语音交互方案。该方案源于其在扫地机器人规模化量产过程中积累的能力,能够解决机器人“听不清、听不懂、做不好”等一系列问题。目前,百度智能云正在为智元远征A3、灵犀X2等量产人形机器人提供语音交互方案,对话反馈延迟可降低至1秒左右。
这1秒,机器人就能够减少明显的停顿和等待,更接近人类自然交流的节奏,这也是其进入商场、酒店等服务场景的基础。
随着机器人批量部署,远程劫持、模型知识产权泄露和行为诱导等风险也随之上升。百度智能云已提供覆盖研发、测试和运营阶段的体系化安全方案及OTA管理运营平台。
至此,一条更完整的链路逐渐显现:数据、训练、仿真和推理构成机器人技能研发的核心流程,语音、安全与OTA能力继续向真机运行和规模化运营延伸。
03.
智元、星动纪元、自变量...
百度智能云的合作版图浮出水面
技术链路能否跑通,最有发言权的,是那些正在造机器人、训练模型和进入现场的企业。
在百度智能云举办的具身智能场景落地专题活动上,北京人形、智元、星动纪元、自变量、帕西尼、原力灵机、吉翼和苏度等多家具身智能头部企业讨论了整机、模型、触觉、数据和工业交付等,这些讨论最终汇聚到几个共同问题:数据和算力能否支撑模型持续迭代,机器人能否长期稳定运行,已经验证的能力又该怎样复制到更多现场。
以北京人形为例,其具身大模型服务单月调用量已经超过12万次,输入输出Token累计超过6亿;星动纪元的机器人则进入了全国五座城市的十多个物流中心,单个场地已经达到数十台部署规模。模型需要面对连续调用,机器人也从单机演示扩展为集群作业,云平台承担的工作随之延伸到长期的算力供给、模型服务和长期运营。
帕西尼与百度智能云的合作更加具体。这家触觉公司在过去14个月里建设了五座数据采集工厂,通过视觉、触觉、运动控制等多种信息还原真实场景中的操作经验,其数据年产能力可达到2亿条。如此庞大的多模态数据需要存储、处理,并不断送回模型训练。帕西尼联合创始人聂相如表示,公司数据用量很大,相关工作离不开百度智能云提供的云服务支持。
数据进入云端之后,合作还要继续向仿真和部署延伸。苏度科技联合创始人兼CEO韩铮提到,团队未来计划在百度云上提供在线调试和数字孪生工具。开发者可以在真机部署前完成仿真测试,再将经过验证的技能装进机器人。
![]()
这一设想与百舸正在打通的仿真评测链路相呼应,也把双方的合作指向了更具体的开发场景。
智元、自变量、原力灵机和吉翼,则把平台需要承接的工作量摆到了台前。智元披露,其第15000台通用机器人已经下线;自变量在真实物流产线上实现了每小时处理1800件、成功率98%,在线学习框架能够支持1000台以上机器人参与优化;原力灵机训练模型使用了上千张算力卡和15万小时计算资源;吉翼搭建的数采训练场,每年可产生超过120万小时有效数据,需要约50PB的存储容量。
![]()
这些数字来自不同企业,却指向同一条产业规律:机器人一旦开始批量进入现场,研发团队面对的就不再是某一次训练或某一段演示,而是持续增长的数据、模型版本和部署节点。任何一环仍靠临时搭建,规模扩大后都会成为新的瓶颈。
百舸提供数据、训练、仿真和推理等研发底座,场景伙伴带来真实任务、运行环境。两者结合,具身企业才能更快找到技术与需求的结合点,将一项经过验证的能力沉淀为可交付、可复制的产品。
04.
结语:机器人走出展台,
靠的是持续进化能力
WRC现场,一套炫酷演示的动作足以吸引人群围观,但热闹散去之后,稳定执行、持续进化、规模化复制,才决定它能否离开展台,真正进入工厂、商场和家庭。
百度智能云收获具身企业的认可,反映出行业对系统级基础设施的需求正在迎来快速增长期。
展台上的一套动作,呈现了机器人此刻已经掌握的能力,能否让这些能力持续迭代、低成本复制,并在更多真实场景中稳定运行,正是具身智能基础设施需要回答的长期问题。
展台演示证明机器人“会做一次”,基础设施决定它能否稳定做一万次。
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.