![]()
许多制造业车间都有“老带新”的传统:新人上岗前先看老师傅怎么做,实在不行,就由老师傅手把手地教。
8 月初,前谷歌 DeepMind 应用机器人(Applied Robotics)团队成员创立的 Reimagine Robotics(简称 R2)宣布走出隐身模式,目前已完成种子前轮(Pre-seed)融资。
他们在英国伦敦和澳洲悉尼设有办公室,正计划把这一经典的培训方式迁移进机器人:工人仅需简短演示操作流程,机器人就能“有样学样”(monkey-see, monkey-do),迅速掌握新技能。
R2 要开创一种名为“交互式机器人”的物理 AI 新范式。用联合创始人兼 CEO 乔纳森·肖尔茨(Jonathan Scholz)的话说:一个有用的机器人,应该能从做这份工作的人身上学习。
把“后训练”搬到工厂车间
早期的工业机器人需要专业程序员预设动作程序,才能运行特定任务,产线发生任何变动,都要重新调整代码,非常耗时。
进入具身智能时代后,机器人模型开始具备一定泛化能力,可以适应不同场景和不同具身形态,但前提是必须投入海量且多元的演示视频进行训练,数据采集和模型迭代之间存在较长的时间差。
R2 并未采取在预训练阶段推高数据规模的策略。它的系统具备初步的通用操作能力,进入工厂后,工人可以直接在机器人面前演示任务,观察机器人的尝试,再当场通过手持机械臂或亲自示范来纠正错误。
乔纳森把这条路线称作“现场后训练”,但主要负责人由 AI 工程师换成了车间工人。不过,这种训练不要求工人懂编程,更不用学习 AI 相关知识,只用像教徒弟一样教机器人做事。
R2 目前公布了两个已落地的部署案例,初步展示了该平台在不同工业场景下的适应性。
在英国一家定制塑料件制造商的工厂里,R2 训练机器人在夜间看管 3D 打印机,工作内容包括取下打印平台、操作锁扣、按压控制按钮等精细动作。
值得一提的是,客户团队在没有机器人工程师驻场的情况下,自行使用 R2 的平台,实现了后续清洗、固化、烘干等工序的自动化。这意味着产品的易用性通过了真实考验,非技术用户也能独立完成新任务的教学和部署。
而在一家关键材料回收企业中,R2 与工艺工程师合作开发了一个三机器人协作的硬盘拆解单元,从报废硬盘中回收贵重材料。此前,开发和测试一项新机器人行为要花费大约一天的时间,R2 入场后,直接将调试时间缩短到十分钟左右。
目前,R2 平台的演示、尝试、纠错、更新基本实现了实时闭环。机器人不再是被动等待被编程的工具或黑箱式的自主智能体,成为一个可以随时接收反馈、更新能力的协作对象。
至于长期部署,R2 称,平台将从单次现场后训练走向持续在线学习,让机器人在长期运行中根据环境反馈和人的干预不断得到改进。
团队从 DeepMind 带走了一整套技术路线
R2 的四位联合创始人曾共事多年,深耕机器人学习领域。
CEO 乔纳森在佐治亚理工学院(Georgia Tech)取得博士学位,研究方向是基于物理的强化学习在自主操作中的应用。2015 年,他加入 DeepMind,创建并领导了应用机器人团队七年。
![]()
(来源:Reimagine Robotics)
奥列格·苏什科夫(Oleg Sushkov)曾在 DeepMind 担任高级研究工程师,参与了跨具身、跨任务机器人基础模型 RoboCat 的核心工作。
米沙·德尼尔(Misha Denil)在牛津大学师从著名机器学习学者南多·德弗雷塔斯(Nando de Freitas),后任 DeepMind 研究科学家长达十年,专注于机器学习基础理论和机器人学习系统。
阿基尔·拉朱(Akhil Raju)硕士毕业于麻省理工学院(MIT)计算机科学系,曾在 MIT 计算机视觉组工作,2018 年加入 DeepMind 担任软件工程师,也深度参与了 RoboCat 项目。
翻阅团队的过往履历不难发现,他们在 DeepMind 主导或参与的多项研究,直接构成了 R2 产品的技术底座。
其中,2024 年正式发布的 RoboTAP 直接对应“从少量示范中学会新任务”的教学方式。这项工作的核心思路是用密集点追踪(dense tracking)技术,从少量演示中识别关键运动,再参数化一个底层控制器来复现这些运动,使模型从几分钟采集的示范中学会形状匹配、堆叠甚至涂胶粘合等复杂操作。
2020 年发布的 Reward Sketching 对应“从人类干预中快速吸收反馈”的纠错机制。该工作提出用人类偏好快速勾勒新任务的奖励信号,再用这个信号回溯标注历史数据,以此加速新任务学习。
四位联创都参与的 RoboCat 是一个跨具身、跨任务的机器人基础模型,探索如何用不同机器人和不同任务的混合数据训练出可泛化的操作能力,这为公司提供了“预训练通用操作能力底座”的架构思路。
R2 另一项突出能力是“硬件、交互和智能一起构建”:用户可以根据任务需要选择不同的机械臂、移动平台和工具,并通过统一的交互与智能层进行教学、适配和部署。
不过,让同一套模型在不同机器人形态之间迁移,一直是让学界和业界感到头疼的难题。从团队过往研究中推测,他们可能选择了追踪物体运动而非模仿人体动作的路线,绕开具身迁移的瓶颈。
直面具身智能参与工厂生产的困境
R2 并未以目前最火热的人形机器人作为核心部署形态,也不追求训练足够通用的具身 VLA(视觉-语言-动作)大模型。
他们选择直面物理 AI 进入生产场景的一系列现实问题,并给出更具体的解决思路:机器人直接与一线工人开展交互式协作,提升任务表现,从而把前期编程或采集数据的需求压缩至相当低的水平。
公司特别强调,在所有部署中,人始终是模型的核心。乔纳森明确表示,“机器人将人的知识转化为杠杆。人们无需重复枯燥的体力劳动数千次,而是可以教会机器人,并将其能力应用到任何需要的地方……我认为它更像是一种放大人类劳动的工具。”
未来,R2 要想得到行业认可,关键在于技术层面的考验。随着部署场景增加,任务复杂度和精度要求都将大幅提升,“少样本示教加纠错”的模式能否真正推广至所有生产流程,仍有待验证。
参考内容:
https://reimaginerobotics.ai/news
https://arxiv.org/abs/2308.15975
https://arxiv.org/abs/1909.12200
https://deepmind.google/discover/blog/robocat-a-self-improving-robotic-agent/
https://www.businesswire.com/news/home/20260803688779/en/Reimagine-Robotics-Goes-Public-With-Robots-That-Learn-on-the-Job
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.