《科创板日报》8月27日讯(记者 李明明)具身智能的技术路线之争,正在从堆数据转向补物理规律。
近日,光象科技联合清华大学李升波教授课题组发布物理原生世界模型Phi-WM 1.0 ActEffect(简称ActEffect),据介绍,这是物理原生智”(Physics-native Intelligence,Phi)技术路线的首个模型化成果。该模型在LIBERO、LIBERO-PLUS和RoboCasa-GR1三项机器人操作基准测试中,分别取得98.8%、80.3%和67.5%的平均成功率。
当前具身智能沿两条主线推进:一是VLA(视觉-语言-动作)模型,靠模仿学习看到什么做什么;二是视频预测式世界模型,靠海量数据拟合未来会变成什么样。
光象实验室首席科学家吕尧对《科创板日报》记者直言,其本质是输入到动作的拟合关系,前端语言模型与后端动作专家之间存在模态鸿沟,仅靠超大规模数据训练VLA得到通用泛化的动作策略,基本不现实。而纯视频预测型世界模型虽能吃到数据规模红利,但“从性能从99%提升到100%过程中的幻觉问题难以解决”,且像素空间的迭代预测在推理部署上难以满足工业节拍。
产业界信号同样密集。今年4月,美国具身智能公司Generalist AI发布GEN-1模型,明确定位为“专为物理交互场景原生构建的基础模型“,将部分物理任务平均成功率从64%拉升至99%,并把单任务适配数据压缩至约1小时 。
方向正在收敛:让机器人理解动作与后果之间的因果,而非记住数据中的表层相关性。
据介绍,ActEffect的核心机制,是把世界模型从”推理时的规划器”改造成“训练时的反馈器“。训练阶段,策略模块一次性生成前馈、粗调、精调三个可执行动作提案,受控世界模型分别预测三个动作的后果,并强制排序——精调必须优于粗调,粗调必须优于初始,且不允许通过压低差方案的评估来“作弊”;后果预测环节刻意不接入语言指令,因为“夹爪施加这个力后零件会怎么动“只由物理规律决定”。训练完成后,世界模型被整体移出推理链路,部署时策略网络一次前向即输出动作——推理算力成本不随训练成本线性增长,这是其工业部署经济性的关键。
光象科技具身智能机器人目前已经在汽车制造场景落地实证。
据公司披露,其工业级自进化具身智能机器人Phi-Bot X1已在不止一家头部品牌车厂的真实产线正式工位完成产品与功能性能验证,进入真机部署阶段;在汽车客户焊接上下料工位,X1实现工件随机抓取,以毫米级精度、0.3°以内姿态精度完成双孔放置,融入生产系统产生商业价值 。在刚结束的2026世界机器人大会(WRC)上,X1完成5天连续36小时焊接上下料与移动质检双工位自主循环作业。
公司创始人张涛给出的账本是:部署效率较传统工业自动化方案提升10倍以上,新工位后训练与上机适配周期约数周,真机后训练数据需求压至“十几到几十小时、最多不超过100小时”。商业模式上,光象按“先卖机器人解决具体问题、二期升级能力客户续费”的路径推进,已在客户侧按此运作。
光象所处的赛道正被政策与资本双重加热。但喧嚣之外,也有泡沫寒冬论。
张涛对《科创板日报》记者回应称,如果行业维持现状,1到2年内寒冬可能到来,穿越周期的方式是“让具身智能的真实商业化价值真正被呈现”——第一个被验证可规模化的应用,就是“那把火”。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.