![]()
裸手遥操 + 4D 手物重建双技术突破,加速具身智能商业化落地。
编辑丨李希
7月30日,忆生科技正式发布EngramTeleOp真机数据采集、EngramEgo真人数据采集两款核心产品。
EngramTeleOp是颠覆式的“全球首款纯视觉真机遥操系统”,面对灵巧操作的核心数据需求,其彻底甩开了对手套等穿戴设备的依赖,操作员无需复杂设备,仅凭MR头显与裸手即可驱动灵巧手,亦可全身遥操作,甚至如影随形般远程操作。
EngramEgo则面对执行者视角的大量数据,利用生成重建一体化的视觉记忆系统,高精度提炼手物交互的数据,其核心指标W-MPJPE达到41.77毫米,误差较此前最优结果大幅降低了27.8%,领跑全球。
数据采集行业很拥挤,但大多数公司做的是设备代工与众包,本质是硬件生意。这一次,忆生科技用算法进行“降维打击”,几乎颠覆了整个现行物理AI的数据获取成本。
“介绍我们这两款产品时,有很多伙伴误会我们是一家数采公司,其实不是。”忆生科技CEO 石志儒在采访中表示,“我们是一家做自主智能的、做可持续学习的世界模型公司。两款产品是我们算法能力的自然衍生。”
01
真正稀缺的不是数据,是有价值的数据
「忆生科技」(TranscEngram)由全球顶级人工智能专家、香港大学计算与数据科学学院创始院长马毅教授与高盛华教授、杨言超教授一起于2023年9月创立。马毅是计算机视觉领域最高荣誉「马尔奖(David Marr Prize)」得主,也是IEEE、ACM、SIAM三料Fellow,拥有二十余年视觉感知与智能系统的理论积淀,并与邵逸夫奖得主Emmanuel Candès 以及图灵奖得主Yann LeCun等全球顶尖学者长期保持深度合作,共同探索下一代人工智能形态。
仅仅一个月前,公司宣布完成数亿元天使轮融资,投资方阵容横跨产业资本与国资平台,包括正大旗下中生制药、浦东创投、张江科投等。
▎而忆生科技最新发布的两款产品,则是公司全产业链布局的组成部分。具体来说,其四大产品矩阵为:
EngramTeleOp智能真机遥操数据采集系统;
EngramEgo执行者视角运动数据采集系统;
EngramControl运动记忆控制小脑;
EngramNav视觉记忆感知大脑。
本次发布的EngramTeleOp与EngramEgo位于整个体系的前端,它们构建了具身智能产业的数据底座,先解决“优质的训练数据从哪来”,再把数据送入后续的控制、导航与记忆系统。
▎目前,具身智能训练数据主要有三种来源:
第一种是真机遥操作:由真人控制机器人的每一个动作进行数据采集,其数据质量最高,可直接用于VLA模型训练,但成本也最为昂贵。例如,DROID用了50名采集者耗时一年,才积累了约350小时的真机数据。
第二种是人类第一视角(Egocentric)或动作捕捉:通过头戴摄像头、动捕服等设备记录人类日常活动的第一人称视频与运动信号,其相对真机遥操作更容易扩量,但一方面容易缺少精确的三维动作轨迹、手指关节状态等数据,另一方面依旧存在人机本体差异。
第三种是仿真数据:在虚拟的物理仿真引擎中构建机器人的数字孪生进行训练,便宜、量大,单条数据边际成本几乎为零,但存在Sim-to-Real差距,且摩擦、柔性物体和复杂受力尤其难模拟。
此外,视频蒸馏/互联网视频派生数据、跨本体迁移等方案也是当前较受关注的新兴技术路径。
但总的来说,好用的太贵,便宜的不好用。
根据Science Robotics预测,按当前采集速率,人类攒够“ChatGPT级”规模的机器人交互数据,需要10万年。
但如果换个角度看,只要我们的采集效率提升一个数量级,“10万年”就会变成“1万年”;而再降一个数量级,问题的性质就变了。
“我们要把它变成100年,甚至10年。”忆生科技CTO杨言超表示。
忆生科技的解决方案,是“以算法替代硬件”。EngramTeleOp、EngramEgo分别瞄准了主流训练数据来源的前两者。
EngramTeleOp是真机遥操作方案,其从纵向降本,大幅降低单次真机遥操采集的门槛与成本,降低设备投入与人员培训时间,提升数据可用率与精度;
EngramEgo则是人类第一视角方案,其从横向扩量,把采集主体从机器人扩展到人,采集规模不再受制于机器人数量,并且提供高质量数据配对算法。
两者共享同一套底层能力:从视觉信号中精确重建人手、人体与物体的三维运动轨迹。一套算法,同时撑起纵向的效率与横向的规模。
02
EngramTeleOp:
把动捕从传感器问题变成算法问题
要理解EngramTeleOp为什么带有产业颠覆性,首先要了解灵巧手动作捕捉这个赛道的现状。
目前,市面上主流的灵巧手动捕方案,大致可以分为四类:电磁式、拉伸传感器式、惯性式和外骨骼式。它们的共同点是依赖额外的传感器硬件。
电磁式手套精度最高,但一只手套价格昂贵,易坏,且必须全程穿戴;拉伸传感器式虽然出货量大,但精度受材料迟滞和手型差异影响严重;惯性式依赖加速度积分推算轨迹,漂移累积是绕不开的硬伤;外骨骼式精度虽好,但结构臃肿、单价高昂,长时间穿戴对操作员来说是巨大的负担。
![]()
这些方案的本质,都是用硬件堆砌精度。每多一位操作员,就得多买一副手套;每换一款机械手,又得再定制一套适配方案。这一路径下,规模扩大并不会降低单位成本,采得越多,成本越高。
EngramTeleOp选择的,是一条截然不同的路:纯视觉算法。
纯视觉映射在学术界早有探讨,但是忆生科技是全球唯一一家把纯视觉算法做到生产级的精度和延迟的公司。数据精度目前介于拉伸动捕手套和电磁式动捕手套之间。随着算法优化,精度还在持续提升。
操作员只需要戴上VR头显,无需任何手套、手柄或遥控器。系统通过摄像头实时捕捉操作员的双手动作,再将其转化为机械臂的指令。
这一路径的硬件成本几乎直线下降,但随之而来的是算法层面的难度飙升。
第一个难题是手部位姿重建,即“看清人手在做什么”。忆生科技能够基于视觉识别并重建操作员双手的完整三维姿态,精确到每一个手指关节的角度与位置。
第二个难题是动作重定向,即“让机械手做出同样的动作”,这也是最难的一步。
人手与机械手在结构上完全不同,手掌大小、手指长短、关节数量、指节比例都存在巨大差异。传统做法是“点对点映射”,本质是一张查找表:记住人手某个姿态对应机械手的某个姿态。但这种方式极其脆弱,遇到没见过的姿态就会错位、失控。
![]()
这正是EngramTeleOp最大的技术突破,忆生科技自研的“生成式小脑”。
生成式小脑摒弃了传统方案的“点对点”死板映射,让模型学习人手与机械手之间的内在运动规律,生成一张连续的映射曲面。
这套算法能够适配不同手型的操作员,既无需逐人标定,也无需针对每款机械手重新开发适配方案。模型一次训练、无限次复制,边际成本趋近于算力成本。不需要购买任何新硬件,每多采一小时数据,模型就变得更好一点,下一小时的采集成本就更低一点。
当前,EngramTeleOp采集的有效数据率由约30%提升至90%,单人日产能提升10至30倍,硬件成本降至传统方案的五分之一。
此外,EngramTeleOp还支持全身多自由度遥操,延迟低于10ms,能够实现跨机械手本体适配,支持跨省跨国的千公里远程操控,并完成旋拧、精密对位、柔性物体操作等高难度精细任务;其标定时间压缩至5分钟,三步快速部署,做到“开箱即用”。
据忆生科技团队透露,目前公司在该领域的前沿理论研究论文也已进入国际顶级会议评审,学术与工程双线并进。
03
EngramEgo:从关键点到几何
如果说EngramTeleOp解决的是“精”,那么EngramEgo解决的就是“多”。
![]()
传统低成本第一视角设备可以记录人类工作,但标定漂移、遮挡和同步丢帧会造成约30%的废片;同时,普通视频很难准确还原手部三维结构、物体姿态和接触过程。
EngramEgo的最大技术亮点则在于,在执行者视角完成数据采集后,系统通过3D网格重建、CUPID遮挡物体生成式重建和4D手物交互重建,将视频转化为结构化物理数据。
首先是手。在系统内,忆生科技输出的不是关键点,而是连续曲面网格:单手778个顶点,双手1556个顶点。从数十个离散坐标到上千个顶点的连续曲面,是表示能力上的跨越,而非精度上的改进。
![]()
其次是身。机器人要走到桌前、弯腰、伸手、抓握、转身、走到另一处放下,需要控制的自由度从手臂的6-7个扩展到全身数十个关节。只有手部姿态的数据,显然无法支撑这类任务的训练。EngramEgo算法体系除了手部数据外,还同步输出全身骨架与人体网格,覆盖头、肩、躯干、腿、足。
然后是物。传统的第一人称方案给出的是二维语义分割,模型知道“那是一个杯子”,却不知道杯子在三维空间中的位姿、朝向与形状。对需要精细操作的机器人而言,这是空间信息的直接缺失。EngramEgo给出物体的重建与六自由度位姿,完整还原物体运动交互信息。
这三层几何重建的背后,是忆生科技自研的4D手物交互算法。基于这一算法,系统可以从第一视角视频中完整恢复“手在哪里、物体如何运动、双方何时发生接触”,并将从人手学到的动作迁移到自由度与关节结构完全不同的机械本体上。这是把“人类日常操作”转化为“机器人可训练数据”的最后一步。
EngramEgo 手物交互重建生成算法领跑全球,最新研究成果将W-MPJPE误差压到41.77毫米,比此前最好结果StableHand 57.83 毫米降低 27.8%。
此外,EngramEgo的物体与位姿联合建模的生成式三维重建CUPID算法,已经入选顶会CVPR 2026 Highlight;其第一视角传感条件下的人体与手部运动估计EgoAllo算法,也已发表于CVPR 2025。
在具体参数方面,EngramEgo采用四颗全局快门相机、IMU与300度水平视场,以60Hz记录操作过程,整机约350克、续航约8小时,端侧支持6路同时采集。
硬件端的轻量化,让数据采集具备了规模化的可能。使用者不需要手套、不需要机器人硬件适配,只要在商超、药房、办公室、洗漱台等真实场景中正常生活、正常操作,数据就产生了。
此外,从最终的客户使用角度,忆生科技还为EngramTeleOp与EngramEgo打造了一套四层数据基础设施,将物理AI数据的派单、审核、标准化、格式转化打包成了一条完整的生产线,客户拿到数据后可直接进入训练流程,无需再进行复杂转换。
据忆生科技透露,目前公司的数据与算法能力已在多家头部人形机器人企业、一线运控上游企业完成运动控制与灵巧操作适配,验证了跨异构本体技能迁移的通用性;并正与制造业头部企业探索高柔性敏捷装配的落地。
04
忆生科技的“自主智能”之路
“数据”,只是忆生科技技术架构的最前端。忆生科技的真正视野,比这要大得多。
要理解忆生科技,首先需要理解一个概念:“自主智能”,或者说“AI 2.0”。
忆生科技创始人马毅教授对此的核心论断是:真正的智能必须像生命一样,在“感知—记忆—预测—交互”的闭环反馈中学习。
在亿万年的演化过程中,动物——尤其是我们人类——正是依靠这种闭环反馈,不断修正行为、提升决策能力,演化出真正的“智能”。
然而,当前的生成式大模型,即AI 1.0,大多从预先准备好的静态数据中学习。模型完成训练后,知识与能力基本固定;面对错误,它无法根据行动结果主动修正认知。但真正的“自主智能”,应当具备从开放世界自主获取信息、形成经验并持续学习的能力。
忆生科技的整个技术路线,都围绕智能的“第一性原理”设计。
忆生科技模拟人类智能,构建了“大脑+小脑”的统一架构:大脑的“视觉记忆”模仿人眼,获取并理解外部环境的物理模型,进行复杂推理;小脑的“肌肉记忆”模仿人手,通过运动控制获取并改善本体模型,生成高频、稳定的运动控制策略。
两者形成的闭环是:大脑看到、预测怎么办、小脑执行、执行结果反馈给大脑、大脑修正判断。
而这套架构的核心,是建立在“记忆机制”之上的世界模型——记忆生成,也是忆生科技的名字来源。
在此前的采访中,忆生科技CTO杨言超表示:“有记忆,才能积累经验;能预测,才能理解交互后果;能持续学习,才能不断适应变化的环境和任务。”
具体来说,忆生科技通过“双模型”并行切入世界模型与具身智能:自主构建并持续进化的物理世界模型(对应大脑的视觉记忆,刻画空间几何结构)与具身决策控制模型(对应小脑的肌肉记忆,记录交互时序规律)。
而前文提及的忆生科技的四大产品矩阵,正是这条闭环链路在产品层面的投射:EngramTeleOp与EngramEgo负责双线采集高质量交互数据,解决“训练数据从哪来”;“小脑”层,将遥操作数据提炼为可复用的运动记忆;“大脑”层,让机器人记住物体、位置与空间结构的关系。数据在闭环中流转,模型在记忆中进化。
他们不造本体,但通过“数据入口+记忆系统+世界模型”的全链路工具链,让任何本体都能接入这套能够理解物理世界、保留长期记忆并持续自我修正的自主智能系统。
而他们的终极目标,是赋予机器智能——模拟人类的学习与记忆机制,构建能从开放世界中自我纠错、持续进化的“硅基生命”。
05
结语
过去两年,具身智能行业的主旋律是“从0到1”,大家都在关注怎么把机器人造出来;本体形态、自由度、关节性能、运动能力等参数,构成了资本与市场对企业的主要评价体系。
步入2026年,竞争的重心开始向后移动——机器人能否进入场景,能否产生价值,能否真正拥有“智能”,成为行业的关注重点。
根据TrendForce预测,2026年,中国人形机器人产量将同比增长94%,全球人形机器人产业也将在下半年进入商业化关键阶段,评价重点从“基础运动能力”转向“可量化的用户价值”。但斯坦福HAI《2026 AI Index Report》同时显示,在仿真环境中,机器人的操控成功率达到89.4%;而在真实家庭场景中,这一数字骤降至12%。
忆生科技技术路径的优势在此时凸显。
相较传统VLA模型,忆生科技基于记忆的生成式小脑架构在多任务平均表现上提升3倍以上,且能用单一模型高质量完成多项任务,成功率超95%。其核心的记忆机制能捕捉任务背后的物理与语义结构,实现机器人/灵巧手跨本体的技能迁移。
“数据荒”是眼下具身智能行业最紧迫的问题,却不是终点。随着产业与资本的持续关注与投入,这一问题终将得到解决。
但忆生科技的“感知—记忆—预测—交互”完整链路及其独创的“自主学习记忆机制”,才是这场技术变革的真正核心。
当前,具身智能产业的竞争重点,已经从一台孤立的机器人,进化到了“本体—数据—模型—场景”组成的完整体系。
忆生科技的技术路线带来的冲击将不局限于具身智能的本体设计或是数据采集,它将从底层开始,打造一套全新的机器自主智能底座,不仅深刻改变现有物理AI产业的技术路径,还将推动具身智能走向真正能够认识世界、积累经验和持续成长的“自主智能 AI 2.0”时代。
![]()
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.