研究员|张叶
近年来,资本加速涌入世界模型赛道,但具身世界模型的技术路线尚未收敛。这种不确定性,反而为创业者打开了入场窗口。
智在无界成立于2025年5月,创始人卢宗青,曾担任智源研究院多模态交互研究中心负责人。2024年,他刚取得北京大学计算机学院长聘副教授资格,便决定跳出学术界,投身具身基础模型创业,在他看来,商业领域的价值标尺更客观,核心就是企业的技术实力与商业化能力。
![]()
卢宗青近日接受第四波独家对话。在他看来,世界模型赛道融资火热,市场过于浮躁,大家都在急切融资拿钱,而智在无界不焦虑。“眼缘对、谈得来”是他选择投资人的重要标准。
在公司注册前的2025年初,联想之星确定了投资意向。联想之星合伙人高天垚说,卢宗青的团队从技术路线解决了训练数据来源有限的问题,在解决具身大模型的任务与环境泛化性、跨本体等问题上,“比国外相似路线的团队更有竞争力”。
目前,智在无界已推出Being-H通用灵巧操作大模型和Being-M通用移动操作大模型,可支持世界动作模型的端侧实时部署。
卢宗青认为,当下很多大模型“能看、能说”,却难“做”,核心短板是缺乏物理交互能力,不懂动作与世界的关联。他跳出“模拟器预训练+少量真机微调”的传统框架,提出用海量人类视频做预训练,让机器人先学人类的动作逻辑,再落地现实场景。
![]()
在智在无界对外披露的技术指标里,最核心的是累计50万小时的第一人称人类视频数据。通过与数十家数据厂商合作,智在无界的人类交互数据库UniHand 3.0覆盖自然物体交互、长时程任务、手部动作以及多样化场景。
但真正决定模型能力的,除了数据规模,还有数据能否准确有效地描述动作、接触与交互。智在无界构建了从数据管线、模型预训练、后训练、评测到端侧部署全栈基础设施建设。
智在无界的通用灵巧操作大模型Being-H,自2025年7月起经历四次迭代,数据规模从数千小时提升至50万小时。7月底,智在无界发布最新Being-H0.8模型,除了数据,还将触觉模态引入模型预训练。
卢宗青表示,触觉的加入,可以使模型感知到视觉难以直接观测的接触状态、受力变化与物体约束,从而完成一系列仅依赖视觉难以稳定解决的接触密集型任务,“要让机器人对物理交互过程,具备更加完整的认知与预测能力,不仅要能够理解看到了什么、做了什么、接触到了什么,还要能够理解世界发生了怎样的变化。”
至于为什么是人类视频数据,而不是仿真数据。卢宗青解释,人类视频数据更适合放在预训练阶段,让模型学习物理世界交互、动作后果及多场景泛化能力。仿真数据则更适合后训练,以及特定场景任务验证,例如打网球,“机器人要抓各种东西,也要会操作各种工具,对模型的泛化性能力的提升,仿真数据无法带来本质性的改善。”
卢宗青说,目前智在无界的数据成本,主要集中在标注和存储,数据采集的边际成本在下降。未来Being-H1.0,数据规模会继续扩大,训练范式也会发生变化,预计今年底,训练数据规模达百万小时。
![]()
按照卢宗青的规划,模型和硬件,在智在无界是同步推进的。
2025年10月,智在无界推出了桌面级灵巧手机械臂 D1,集合了六轴机械臂、灵巧手和主动视觉系统三大功能。他们还将发布D1产品系列,将主要面向教育市场,用于学习具身模型相关知识,学生可以从0开始搭建自己的机器人。
卢宗青说,目前在工业场景中,真正落地的多是协作臂类传统形态的机器人。具身智能的核心技术卡点,仍集中在基础模型层,“当基础模型成熟,具身智能市场对硬件形态的定义也会发生变化。”
他判断,人形机器人落地商业场景的周期,至少需要3—5年。在商业化方面,他认为基础模型未来更多是通过第三方集成商完成模型服务的供给,“ToB需要非常下沉的打法,同样是抓取任务,汽车厂、食品厂、电子厂、物流仓的具体工况完全不同,集成商更懂客户真正的场景需求。”
“终极目标是C端市场,尤其针对特殊群体和特定场景”,卢宗青认为,只要产品做得好,未来C端用户是会愿意花钱的,“根据模型能力和用户需求重新定义C端产品的硬件形态,未必是现在的人形机器人形态。
编辑|邱慧 张猛
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.