![]()
公司情报专家《财经涂鸦》获悉,7月18日,WAIC京东论坛“AI进入物理世界:模型、数据、终端与场景”在2026世界人工智能大会期间举行。论坛聚焦AI从数字世界走向物理世界的趋势,围绕具身智能、智能终端与真实场景,讨论AI如何从理解和生成进一步走向感知、决策与行动。
京东集团副总裁、京东探索研究院副院长段楠在《从数字AI到物理AI》演讲中指出,互联网数据本质上是数字世界的信息载体,难以让模型真正学习如何与物理世界交互并驾驭物理世界。人工智能若要迈向更高水平的通用性,就必须从数字世界走向物理世界。
这也意味着,大模型在数字世界中形成的规模化路径,需要在物理AI阶段被重新定义。
物理AI的Scaling Law,需要增加硬件维度
段楠认为,相比数字AI,物理AI首先要解决物理数据的规模化问题。模型不仅要从海量数据中学习通用知识,还要从包含丰富物理信息的真实世界数据中,学习三维空间结构、物理属性、运动轨迹等规律与因果关系。
其次是持续学习的规模化。物理AI需要在与真实世界的交互中不断获得反馈,并据此持续进化和调优。与处理相对静态的互联网语料不同,物理世界不断变化,模型的学习也不能停留在一次性训练阶段。
第三,物理基础模型本身需要取得新的突破。它不仅要理解和重建空间、对物理规律进行建模,还要具备模拟和操作硬件的能力,并实现跨本体、跨任务、跨场景的泛化。
在此之外,硬件协同也必须实现规模化。无论是采集大规模具身数据、训练具身模型,还是最终将模型部署到机器人、可穿戴设备等不同本体上,都离不开硬件层面的规模化协同。
段楠由此总结,Scaling Law从数字AI走向物理AI后,不能再只关注数据、模型与算力,还要把硬件规模化纳入其中。数据、模型、算力和硬件,将共同构成物理AI能力持续提升的四个维度。
从数字智能到物理智能的三阶段路线
在这一趋势下,京东探索研究院将核心使命聚焦于构建自主可控的AI基础模型矩阵,重点推进多模态基础模型与具身模型研究,并将技术演进划分为三个阶段。
第一阶段是数字智能。以语言模型、代码模型和多模态模型为基础,让AI能够感知、推理和生成数字内容,并通过智能体自主完成数字世界中的任务。
第二阶段是附身智能。将基础模型部署到可穿戴设备、智能座舱等各类终端,使其能够持续观察用户与环境,实现人与设备、设备与设备之间实时、自然的交互协作。
第三阶段是物理智能。模型被部署到机器人等真实硬件中,不仅要感知环境,还要预测世界状态并采取行动,最终自主完成物理世界中的任务。
围绕这一路线,京东探索研究院已形成覆盖图像、视频、实时交互、语音和具身智能的模型布局。不同模型并非彼此孤立,而是在补齐AI进入物理世界所需的空间理解、时间连续性、实时感知、自然交互与行动能力。
从空间理解到实时交互,模型能力加速补齐
在图像理解与编辑方面,京东探索研究院于今年4月推出并开源JoyAI-Image-Edit。该模型将图像空间理解与空间编辑整合进同一框架,并在相关空间感知评测中展现出与领先闭源模型相当甚至更优的表现。更重要的是,团队通过引入图像编辑能力反向提升模型的空间理解能力,初步验证了“生成辅助理解”的新范式。
6月推出的JoyAI-Echo则聚焦长程视频生成。该模型支持分钟级音视频联合生成,并围绕长视频内容一致性、多模态记忆、音画同步以及对话式交互进行创新,为后续的视频世界模型奠定技术基础。
同月开源的JoyAI-VL-Interaction是一款实时视频交互模型。它能够持续理解视频流,并根据环境变化和用户需求自主判断何时响应、如何交互,使多模态模型从处理单次输入,进一步走向对真实环境的持续感知。
在本次论坛上,段楠还首次披露了JoyAI-Video-Edit实时视频编辑模型。该模型可对流式视频进行超过30 FPS的实时编辑。段楠表示,这类技术不仅是视频生成的重要方向,也可为附身智能中的全模态实时交互、具身智能中的大规模数据合成提供底层能力,相关技术报告将于近期开放。
同时亮相的JoyAI-Talker采用语音与语言原生预训练架构,支持语音理解、推理和生成一体化,并具备低延迟、语义级交互能力。模型还可对情绪、语气、语速等表达特征进行精细控制,为附身智能和具身智能提供更自然、更具共情能力的语音交互。段楠表示,高共情语音交互将是研究院持续投入和迭代的方向。
物理基础模型将有新进展
模型进入物理世界,离不开可规模化、可验证的真实数据。今年4月,京东开源具身智能人类视角数据集EgoLive,覆盖仓储、家庭、药房等特色场景以及300多种典型操作任务。目前,京东已收到来自全球数百所高校、企业和科研院所的数据申请。
围绕自采数据集,京东同步推出JoyAI-RA具身操作模型,验证随着数据规模扩大、场景和任务更加多样,模型在理解、推理、预测和最终操作等环节的能力能否同步提升。随着具身数据集持续扩容,京东还将进一步验证这一规模化路径。
随后推出的JoyAI-Sim仿真架构,可支持人类操作数据与具身操作数据之间的双向转换。一方面,它有助于缓解机器人操作数据获取困难;另一方面,也为仿真训练与真实世界训练的协同提供底层平台。
依托京东零售、物流、工业、健康等多元业务场景,京东探索研究院还在搭建面向真实产业和具身智能任务的评测数据集与平台,并计划于今年下半年发布。其核心思路是让数据、模型、仿真和真实任务形成闭环,以实际场景中的能力提升检验技术价值。
段楠透露,今年下半年,京东探索研究院将陆续发布一系列新成果:在数据规模化方面持续推出阶段性进展;在物理基础模型方面,相关工作也在加紧推进,计划于今年9月至10月推出最新模型。
与此同时,京东还将持续建设覆盖千行百业与具身智能场景的评测平台,加快京东内部及开源社区从数字世界向物理世界的技术跃迁。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.