京东段楠WAIC演讲:从数字AI到物理AI,Scaling Law要加上硬件这一维
![]()
段楠,京东集团副总裁、京东探索研究院副院长,2026年1月升任该职,直接向刘强东汇报。此前他曾任阶跃星辰Technical Fellow,更早的十二年在微软亚洲研究院自然语言计算团队担任资深首席研究员和研究经理。学术兼职包括中国科学技术大学、西安交通大学兼职博导及天津大学兼职教授,发表学术论文200余篇,Google Scholar引用超28000次。2019年获评CCF-NLPCC杰出青年科学家,2023年入选DeepTech中国智能计算创新人物。
2026年7月18日上午,段楠在WAIC京东论坛发表演讲《从数字AI到物理AI》,这是他就任副院长后首次在公开场合系统阐述京东探索研究院的技术路线。
这场演讲的核心判断是:Scaling Law需要从数字世界的“数据+模型+算法”三位一体,扩展到物理世界,把硬件的规模化也加进来。段楠把物理AI的规模化拆成四个维度——物理数据规模化、持续学习规模化、物理基础模型能力、硬件协调规模化,并用“附身智能”作为从数字智能到物理智能的中间阶段:先让模型部署到手机、电脑、可穿戴设备等终端,再走向机器人和真实物理硬件。
演讲中有几个值得注意的信息点:一是京东探索研究院首次公开了实时视频编辑模型和高共情语音交互模型Joy AI Talker,两者均尚未对外发布;二是宣布今年9、10月份将推出物理基础模型的最新成果;三是披露了2000小时具身操作数据集已收到全球数百个机构的申请,以及配套仿真平台Joy AI Sim支持人类操作数据与具身操作数据的双向转换。从组织层面看,刘强东亲自担任探索研究院院长,段楠作为副院长直接向其汇报,说明京东已将AI研发提到了最高决策层级。
以下为段楠演讲原文。
附:段楠WAIC 2026演讲原文
今天非常荣幸在这里给大家做报告,题目是“从数字AI到物理AI”,说的是人工智能的规模化演进。
如果我们回顾人工智能过去七十多年的发展,经历了四次技术浪潮。最早的专家系统到统计学习,一直到今天的深度学习和基础模型,整个演进可以看成在数据、算力和模型上的持续规模化。拿基础模型为例,受益于互联网海量数据像自建工具训练和强化学习后训练,这样的结合,以及现在从百亿、千亿到万亿的模型架构,现在基础模型包括语言、语音、多模这样的领域都取得了跨越式提升,体现出非常强的范化能力和跨任务的迁移能力。
同时,互联网数据还是数字世界信息的载体,没办法让模型学习到如何真正交互和驾驭物理世界,如果人工智能未来面向更高水平的通用性,必须从数字世界走向物理世界,涉及到的技术就是物理AI。
相比数字AI,物理AI对规模化提出了新的要求。
第一,它需要做到物理数据规模化,因为物理AI不仅要从海量数据中学习通用常识知识,还要从蕴含着非常丰富的物理信息的真实世界数据中学习物理规律和因果关系,比如三维空间结构、物理属性、运动轨迹等。
第二,它需要做到持续学习的规模化,因为它需要同真实世界交互中不断获得反馈,进行持续进化、持续调优。
第三,物理基础模型本身也要有新的进展。因为和数字AI不同,物理AI的特点是要对空间的理解重建,包括对物理规律的建模,对硬件的模拟、操作以及刚刚像杨老师提到的跨本体、跨任务和跨场景的泛化能力都要有很好的支持。
最后有一个新的维度,硬件协调需要规模化。不管是采集大量具身数据还是训练具身模型,最终把这些东西部署到本体上,都需要在机器人硬件和可穿戴设备上同步做到规模化的协同。
所以一句话总结:Scaling Law这件事情,从数字世界的数据、模型和算法三位一体化的范式发展到物理AI,要把硬件的规模化也加进来。
在整个物理AI大的趋势和浪潮下,京东探索研究院核心使命是构建自主可控的,AI基础模型的矩阵。我们希望这样的模型,能够助力京东集团完成从数字AI到物理AI的技术跃迁,让人工智能技术覆盖我们在集团内部遇到的,像零售、物流、工业、健康等核心的场景,最终实现助力京东集团,成为全球最大的物理世界运营中心的愿景。
围绕着这个使命,整个研究院更加聚焦多模态基础模型的研究以及具身模型研究,我们也把整个技术路径分三个阶段:第一阶段是数字智能阶段,主要以语言模型、代码模型、多模模型为基础,让模型能够感知、推理、生成数字内容,并通过智能体的方式,自主完成数字世界的任务;第二阶段附身智能阶段,把整个基础模型部署到包括手机、电脑、可穿戴设备、智能驾舱等各类终端,持续实时观测用户和环境,最终实现人与设备、设备和设备之间,非常实时自如的交互和协作;第三阶段是物理智能,说白了最重要是把模型部署到真实的物理硬件,让这些硬件感知世界,对这个世界的状态做预测,最终完成自主化的物理世界的任务。
接下来汇报一下京东探索研究院在过去半年的阶段性工作以及小小的展望。我们在图像理解编辑方面,今年4月份提出了Joy AI image Edit,这个模型和之前传统的图像理解生成模型相比,最核心的贡献是两点:第一把图像的空间理解和图像的空间编辑整合到同一个模型中,并且在这两类空间感知相关的评测集上,持平甚至超过了Gemini pro 2.5、banana pro和Seedance 4.5的闭源大模型。第二我们通过引入图像编辑能力,可以反向促进,模型对图像内部空间理解的能力,初步验证了生成可以辅助理解的新范式,这个模型已经在社区做了相关开源。
第二个工作是音画联合生成,是今年6月份发的。这个模型的特点是支持分钟级的音视频联合生成,并且在人工评测的指标上,超越了HappyHorse 1.0等相关的音画同步生成的基线模型。我们模型在长程视频内容一致性生成上,做了对于记忆能力,尤其多模态记忆能力的创新,包括音画同步,在后训练和实时推理里的创新,以及最后如何让模型能够做非常自由的交互,为我们后续做下半年的视频事件模型奠定了技术基础。
下一个模型是我们最新6月份推出的实时视频交互模型,这个模型很有意思,它最核心的点是在全球首个开源的,能够做到真正实时自主交互的多模态理解大模型。这个模型能够对持续的视频流做实时理解,通过自主交互满足用户提出的问题和用户存在的需求,这个模型在社区也进行了开源,在很多实时视频交互场景上,取得了超越字节、豆包和谷歌的实时交互能力,大家感兴趣可以下载体验。
视频编辑方面,最近完成了一个工作,但没有对外。而WAIC是很好的机会,做一个介绍,实时视频编辑模型,支持超过30FPS对流式视频做实时编辑的能力,我们也在各种相关视频实时编辑基准测试集上,和最新出现的三四个闭源的模型做对比,都取得了非常好的效果。我认为这样的技术,它不仅是视频生成发展的重要方向,也是未来我们在附身智能真正做到全模态的实时交互以及我们在具身智能领域里,做大规模数据合成,提供了非常底层的技术积累。我们也会在近期开源我们的技术报告。
实时语音交互方面,这是第二个我们还没有正式发布,近期完成的工作,我们叫Joy AI Talker,它是语音和语言的原生预训练架构,它支持语音的理解、推理和生成一体化的架构,也支持非常低延时,语义级别的交互能力。它最重要的特点是能够非常精准的控制我们生成的语音内容,包括情绪、语气、语速等表现力相关的特征,能够在语音交互和情感高共情的语音交互场景上,我们取得了世界一流的水平,这个模型会在后续为附身智能、具身智能提供非常高效、自然、高共情的语音交互体验。
高共情的语音交互能力是我们会持续发力和持续迭代的能力。在整个具身智能的发展方向,我们今年4月和6月分别发了两个工作,后面我的同事会做详细的介绍。这个数据第一批是2000小时,覆盖了仓储、家庭、药房等特色场景,以及300多个典型的操作任务。现在收到了全球数百个高校、企业和科研院所的数据申请。
与此同时,我们右边推出了Joy AI sim的仿真架构,它能够支持人类操作数据和具身操作数据双向的自由转换,既解决了机器人操作数据获取难的问题,也为后续我们做整个具身数据金字塔,包括我们把大规模仿真和真实世界的训练做协同,做好了底层平台级的准备。
围绕京东自采数据集,我们今年4月份同步发了Joy AI RA0.1的具身操作模型。这个模型主要目的是验证具身基础模型和其他基础模型,随着数据规模扩大和多样化,具身模型能力在理解、推理、预测到最终操作效果上都取得同样的效果。我们初步验证了这样的结论,后续会随着具身数据集整个体量不断扩大,进一步验证效果。最终目标是希望在具身领域达到像GPT3或者Chat GPT能力引线的时刻。
除了对模型和数据,我们也非常关注整个评测的建设,受益于整个京东平台非常多元化的业务体系和业务环境,我们现在正在搭建针对包括零售、物流、工业、健康等真实场景以及针对具身智能场景的评测数据集和平台,我们希望这样的工作能够为基础模型在千行百业和具身智能发展中,提供更加系统和科学的评测体系。我们在下半年的时候会发布这样的评测平台。
整个在研究院的工作最终还要落地到真实的场景中,积极响应国家对科技创新和产业创新深度融合的号召,希望后面能够和在座各位有更多在模型落地应用的合作。
小小预告一下,今年下半年会陆续发布一系列新的工作。包括数据方面,数据规模化方面会持续推出新的阶段性结果;物理基础模型相关的工作上,目前正在紧锣密鼓地推进,我们希望在今年9、10月份推出物理基础模型上的最新模型;最后我们会持续构建千行百业和具身相关的评测平台,我们希望加速京东集团甚至包括社区,从数字世界到物理世界的技术跃迁进展。
最后,京东探索研究院欢迎大家多关注、多交流、多合作。谢谢大家!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.