作者 | 黄楠
编辑 | 袁斯来
硬氪获悉,人形机器人基础模型公司德塔智能(Delta Intelligence)近日完成近5亿元天使++轮融资,本轮投资方包括多家上市公司产业方和头部财务投资机构。资金将主要用于人形机器人基础模型持续迭代,加快自研数采设备的量产与数据闭环建设,扩充核心研发团队,以推动技术在真实工业场景中的工程化落地与验证。
这也是公司成立半年内完成的第六轮融资,此前,投资方包括北京通研院、智元机器人、乐聚机器人、星海图等人形机器人主机厂,高瓴创投、元禾控股、复星锐正、华映资本、联想创投等财务机构,以及汽车、半导体领域资本。
德塔智能成立于2026年1月,专注研究原生通用人形机器人基础模型 HFMs(Humanoid Foundation Models),最终实现通用的人形全身协同操作(Loco-Manipulation),推动具身智能向工业与家庭场景的真实应用。以人形机器人为载体,加速物理通用人工智能(Physical AGI)的到来。
三位核心创始人均获UCLA博士学位,具有清华本科、北大任教等学术背景。团队的技术专长覆盖机器人学习、大规模机器学习、机器人系统与具身智能,研究及产业经历横跨Google Robotics、NVIDIA Research、DeepMind、Meta、北京大学和北京通用人工智能研究院,并参与过多项美国DARPA、ONR及NSF机器人项目。多元的研究方向与横跨学术界、产业界的实践积累,使团队形成了从前沿研究到技术落地的全栈软硬件能力。
具身智能赛道正从运动展示加速迈向物理作业。德塔智能团队创立背后,源于一条清晰的技术路径探索:双足人形机器人的基础模型,必须从一开始就为“全身智能”而建,而非在既有框架上进行迁移复制或填补。
一个必须面对的事实是,人形机器人走出实验室之后,面对的是带有台阶、门槛、楼梯及其他特殊地形的真实物理空间。这些场景中,机器人既要移动,又要操作,还需在动态环境中持续保持平衡与决策,要实现全身协同操作,前提是设备对所处空间有足够精准的认知——这种空间理解必须是三维的、实时的、无歧义的。
然而,当前主流的具身智能模型中,其空间认知仍建立在二维视觉表征之上。当机器人走进工业生产、能源运维、家庭服务与户外巡检等真实复杂环境,二维视觉表征容易带来缺失真实空间深度,几何关系存在歧义,大场景中上下文易爆炸的问题,进而制约机器人环境理解与安全作业能力。
举个例子,当机器人站在门前,二维表征往往难以准确判断门把手距离、开门方向、身体空间如何变动才能让出开门空间。这种模糊判断随着设备进入真实场景,容易累积并放大动作误差,导致长时序连续作业无法完成。
为了消除这一结构性偏差,德塔智能选择构建一套原生三维世界引擎,以三维表征作为模型核心,可直接处理点云,高斯泼贱等三维场景表示,实现原生的三维理解,推理和对未来环境状态的推演。
![]()
全身全景人类数据采集与全身技能学习(图源/企业)
引擎的运转需要持续的数据供给作为前提,德塔智能自研了一套全身全景数采设备,采用纯视觉采集架构,可以同步捕捉手、脚、腰、肩全维度人体骨架关节运动轨迹,基于第一视角视频流实时增量重建全局三维场景。
其中,单次采集可输出核心训练素材包括两类,一类为完整人体全身骨架数据,还原手脚协同、重心切换、借力操作等真实交互逻辑;第二类是高精度三维场景数据,记录障碍物、台阶、操作台面等环境物理参数。
在采集路径设计上,德塔智能针对不同开发阶段规划了分层方案,包含搭载机器人本体的遥操作采集,以及无需实体机器人的UMI、Ego-centric无本体动捕模式。无本体采集效率更高、硬件成本更低,可适用于大规模积累通用全身交互样本;遥操作采集则用于后期的真机微调与精度对齐。两种模式搭配使用,更好地在数据规模、采集成本与真机适配精度之间实现平衡。
“市面上多数数采方案仅能采集手部等局部动作,基于此训练的模型难以完整理解人与环境的交互,也难以掌握攀爬梯具、推拉重型门等依赖全身协同的复杂任务。” 德塔智能创始人兼CEO马晓健认为,人形机器人的学习逻辑应当对标人类,必须完整采集全身与环境的交互行为,才能搭建无认知偏差的世界模型。
![]()
全身全景数据可视化(图源/企业)
而精准理解三维空间只是感知层基础,机器人能否把高层任务意图转化为毫秒级精准肢体运动,是落地作业的另一重核心门槛。高自由度人形本体拥有数十个联动关节,单一高层指令无法直接驱动全身平衡、发力、位移,底层控制链路复杂度极高。
此前常见做法是,将规划模型输出的指令直接下发给底层控制器,这套方式在低自由度的机械臂上尚且可行,但面对高自由度的人形机器人,中间缺失的全身协同调节模块会直接导致动作卡顿、发力失控乃至失衡摔倒。
为了解决这一断层问题,德塔智能搭建的是“大脑+小脑+力位混合”三层原生协同架构。三层模型分工明确、闭环联动。大脑模块搭载自研三维世界引擎,负责环境感知、长时序任务规划、高层交互意图输出;小脑是基于海量仿真强化学习训练的神经网络,接收大脑稀疏高层指令,转化为数十至数百赫兹的全身电机精细控制信号,实时动态调整重心、协调四肢发力,解决高自由度本体平衡控制难题,最后经由获得力位混合层输出柔顺的控制。
这套大小脑分层架构的差异化价值,在全尺寸人形,五指灵巧手等高自由度设备上会充分释放。小脑依托全身全景交互数据持续迭代,可自适应适配各类复合全身任务。
![]()
全身采集与人形机器人物流场景作业(图源/企业)
马晓健判断,随着具身智能产业化加速,算法模型企业与硬件主机厂深度协同将成为主流发展模式。依托完整底层技术体系,德塔智能团队已与智元、乐聚、星海图、宇树等头部人形机器人厂商建立长期合作,依托标准化的本体适配流程,实现模型在不同硬件平台间的快速迁移。作为人形机器人生态中的基础模型提供方,公司致力于为各类本体提供可部署、可扩展的全身智能底座,成为连接硬件平台与上层应用的关键一环。
以下为硬氪与德塔智能创始人兼CEO马晓健的访谈节选(略经编辑):
硬氪:基于原生的大小脑架构,真实数据和仿真数据的配比策略是什么?背后如何考量?
马晓健:先说“配比”概念本身,我们并不是在一个统一的数据池里,多少给大脑、多少给小脑,而是两套完全独立的训练体系,服务于不同的优化目标,根源在于大脑、小脑承担的任务属性完全不同,对应的物理交互规律也不同。
大脑负责全局环境理解、长时序任务规划和全身操作决策,我们不依赖仿真数据。根本原因在于仿真系统的接触建模能力不足。人形机器人在工业巡检、物料搬运、爬梯等真实作业中,会同步发生手部夹持、足部承重、躯干借力等多点复合接触,而仿真器很难精准复刻柔性形变、滑动摩擦、多触点受力这类复杂交互。
大脑如果基于失真的仿真信号学习任务策略,学到的是仿真世界的操作逻辑,部署到真机上极易失效。因此,德塔的大脑训练,必须依赖真机原生交互数据。
![]()
家务场景长程全身协同任务作业(图源/企业)
小脑负责底层全身协调和动态平衡控制,情况完全相反,我们以仿真环境为核心训练载体。平衡控制本质上是一个连续状态到动作的优化问题,关键在于重力模型和关节动力学的准确性,而这两件事物理引擎已经做得很好了。小脑在仿真器中通过强化学习进行海量试错,仅在收尾阶段用少量真机动捕数据做校准微调。
简单来说,大脑要学复合交互操作,对真实接触物理要求极高,只能以真机数据为核心;小脑要学动态平衡,依赖物理规则即可迭代,仿真能低成本供给无限试错样本。二者数据链路和训练目标天然拆分,不存在统一的配比标准。
硬氪:各家双足人形本体硬件参数、关节约束、动力学特性差异较大,德塔智能的通用人形基础模型如何完成跨本体快速适配?
马晓健:针对不同厂商的人形本体,我们沉淀了一套标准化的适配流程,分为四个环节:全身动捕数据采集、跨本体运动重定向、小脑仿真强化学习、大脑快速微调。每个环节都有相当程度的技术壁垒,也是我们多年在三维视觉和人形全身协同上的持续积累。
以重定向环节为例,人体有数十个自由度,而各家本体的自由度、尺寸、关节限位、重心分布都不一样,硬件差异天然加大了动作映射的难度。
德塔智能的重定向算法是基于多约束优化来解这个问题。一方面,所有关节运动值必须严格落在本体限位区间内,避免碰撞和卡顿;另一方面,要完整保留原始动作的核心发力逻辑,像开门借力、爬梯这类全身协同动作,重心轨迹和手部轨迹不能出现偏移,否则机器人复刻不出人类的发力方式。
重定向完成后,大脑和小脑分开推进。小脑负责全身平衡和肢体协同,在仿真环境里做强化学习,不占用真机资源,迭代效率很高,其中难度最大,不确定性最高的sim2real环节,得益于我们多年的经验积累和与头部主机厂的密切协同,可以实现更快的迁移。大脑负责场景理解和任务决策,依托我们预训练底座已经具备的通用认知能力,面对新本体只需要少量真机数据做微调,就能匹配硬件特性,快速落地多样的家居和工业场景任务。
整套流程下来,我们不需要每换一个本体就重新采集大规模数据、从头训练整套系统,适配周期和硬件损耗成本都大幅降低。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.