7月20日,2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)在上海落下帷幕。
大会期间,来自全球的科学家、产业领军者、投资机构与创新企业代表齐聚上海,围绕人工智能技术演进、产业落地与全球治理等议题展开交流。
当人工智能进入新的发展阶段,行业关注的核心问题,正从“模型能够生成什么”,进一步走向“模型能否理解世界、预测世界、在世界中交互、在世界中行动”。
围绕这一趋势,生数科技亮相 WAIC 2026,通过一场专题论坛与一个互动展区,集中呈现世界模型在数字世界内容生成、实时交互和物理世界行动等方向的最新探索。
从世界生成模型Vidu、实时交互模型 Vidu S1,到世界动作模型 Motubrain,世界模型正在从前沿技术概念,逐步走进可体验、可验证、可应用的产业现场。
01聚焦论坛:世界模型走进AI影视生产全链路
7月20日上午,由生数科技与万兴科技联合承办的“世界模型驱动下的AI影视生产力新范式”专题论坛,在上海世博展览馆举行。本次论坛贯通 AI 基础设施、世界模型、创作工具与影视内容产业链,汇聚来自模型、算力、创作平台、影视制作及数据服务等领域的产业代表。
![]()
论坛上,生数科技创始人、清华大学人工智能研究院副院长朱军发表题为《通用世界模型:连接数字世界与物理世界的新基础设施》的主题演讲,系统分享了通用世界模型的技术演进、核心能力及产业应用路径。
朱军表示,人工智能正在从理解和生成数字内容,进一步走向对世界规律的建模、推理、预测与行动。世界模型不是视频模型的升级,也不是语言模型的延伸,而是 AI 从“生成内容”迈向“理解世界、推演世界、与世界实时交互”的新范式。
伴随AI技术发展,万兴科技创始人、董事长吴太兵提出AI影视“生产范式重构”的核心产业判断,他强调AI绝非影视行业的效率辅助工具,而是正在彻底重构产业运行的底层逻辑,影视产业正站在第四次技术跃迁的关键起点,AI影视是具备千亿级增长潜力的全新数字内容赛道。
而AI影视全链路落地,离不开算力基础设施的核心支撑。阿里云智能集团资深副总裁、公共云事业部总裁刘伟光表示,世界模型开启新一轮生产力革命,对算力底座、训推一体、数据与工程化能力提出挑战;阿里云提供从数据、算力、训练、推理到Agent部署及全球化的全栈支撑,为世界模型迭代全栈就绪。
在圆桌环节,来自技术、工具、资本、内容、出海赛道的五位产业核心操盘手齐聚,围绕“AI影视进入产业深水区:模型、内容和全球化的新协同”主题开展深度研讨,为行业高质量发展输出了兼具实操性与前瞻性的一线共识。
![]()
骆怡航认为,模型层最重要的价值,是为创作者提供更大的自由度,持续提升生成速度、效率、场景适配能力和成功率,让创作团队把更多时间投入IP、剧本、角色和内容打磨。当前,中国已在视频模型、创作工具、内容生态和文化IP等方面形成结构性优势,中国AI影视的全球化不仅是内容出海,也包括以模型能力服务全球本地创作者。正如他所说:“生数科技坚持把模型做好,让创作团队能够自由地沉浸于创作,让更多的故事动起来”。
活动现场,生数科技与万兴科技牵头发起成立“万剧出海共创联盟”,并与创始联盟伙伴完成联盟签约仪式,共同构建面向全球的AI出海新生态。联盟将以“技术+内容+创作+发行+投资”的全链路协同模式,推动AI影视产业规模化出海。
创始联盟伙伴成员覆盖产业全链路:技术层联合生数科技等提供底层模型能力,生数科技以通用世界模型为基,为万剧出海提供AI生产力底座;内容层联合长信传媒等头部内容机构,链接全球IP资源;创作层联合灵漫快创等链接全球创作者;发行层联动StoReel、东麟影视等平台打通内容出海与全球变现;投资层联合“浙文投”旗下之容无限等产业资本,探索“资金+算力”创新孵化模式。
02 展台直击:从生成数字世界到行动于物理世界
论坛之外,生数科技的通用世界模型技术及产品也在 WAIC 展区集中亮相。以通用世界模型为底座,生数科技持续打造连接数字世界与物理世界的桥梁。
![]()
在数字世界,Vidu 支持文生视频、图生视频、参考生视频等创作方式,持续提升内容生成的一致性、物理合理性与交互性;Vidu S1 进一步推动视频生成从离线内容走向实时互动。
在物理世界,世界动作模型 Motubrain 以一个通用大脑驱动多种机器人理解、预测并行动于世界,推动通用世界模型从“视觉推演”迈向“物理决策”。
展区现场,参会者通过 Vidu Q3、Vidu S1 和 Motubrain 等技术及产品演示,直观体验了世界模型在内容生产、实时互动及具身智能等场景中的应用。
世界生成模型Vidu
作为生数科技面向数字世界打造的世界生成模型,Vidu 依托基座世界模型对人物、物体、场景、运动及视听信息的理解与重构能力,为创作者和企业提供多模态内容生成能力。
Vidu 支持文生视频、图生视频、参考生视频等创作方式,持续提升主体与场景一致性、运动表现、物理合理性、镜头控制及内容交互性,帮助创作者更加高效地完成高保真内容创作。
不同于仅生成单段画面,Vidu 进一步探索内容背后人物关系、空间结构、动态变化和物理规律的建模与推演,推动模型从“生成数字内容”走向“理解世界规律并构建动态数字世界”。
目前,Vidu 已形成覆盖 SaaS、MaaS API、Agent、ViduClaw 等形态的产品与服务矩阵,持续服务广告、短剧、漫剧、影视、电商等行业,推动 AI 视频从创意展示走进规模化内容生产流程。
![]()
实时交互模型Vidu S1
如果说传统视频生成解决的是“生成一段内容”,那么 Vidu S1 进一步探索的是“生成一个能够实时回应并持续互动的数字角色”。
展台现场,用户可基于真人、动漫、萌宠等任意初始形象和个性化音色,快速创建专属交互角色,并通过语音与角色实时交流、控制视频走向。
![]()
Vidu S1 能够结合语音语义、情绪、对话上下文及当前画面,实时生成角色的口型、表情、眼神、手势、身体姿态和后续动作,不再局限于简单的口型驱动或预设动作。
模型支持实时视频通话和无限时长连续互动,可实现 540P、25FPS 的视频通话级输出,最高支持 42FPS,在生成质量、响应速度与交互连续性之间实现平衡。
从生成一段固定视频,到生成一个能够实时回应、持续互动的数字角色,Vidu S1 将视频生成进一步带入实时、连续、可交互的新阶段,为 AI 情感陪伴、虚拟偶像、互动直播、游戏 NPC、品牌数字人、智能客服、在线教育及 XR 等场景提供新的技术基础。
世界动作模型Motubrain
作为生数科技连接数字世界与物理世界的进化核心,世界动作模型 Motubrain 定位于具身智能机器人的通用大脑,以一个通用大脑驱动多种机器人理解、预测并行动于世界。
Motubrain 采用 Mixture-of-Transformer(MoT)架构,将环境理解、世界状态预测与动作轨迹生成整合至统一模型框架,减少多个模型逐级协作带来的信息割裂与误差累积,使理解、预测与行动围绕同一任务目标协同完成。
通过学习不同机器人本体、任务和场景之间可共享的世界知识,世界动作模型 Motubrain 具备多本体适配、多任务泛化和长程任务执行能力,能够驱动不同形态的机器人在家庭、工业、商业等真实场景中,更稳定地完成连续复杂任务。
在多任务场景中,世界动作模型 Motubrain 能够保持稳定表现,并通过共享不同任务之间的世界知识提升多任务泛化能力;在多本体场景中,一个模型能够适配多种机器人,探索打破“一个机器人一个模型”的传统模式;在长程任务中,模型能够直接学习完整任务链路,无需上层规划、任务拆解或多模型拼接;在动态环境中,模型能够理解并预测环境变化,据此持续判断、调整与行动。
在 RoboTwin 2.0 榜单中,世界动作模型 Motubrain 在 Clean 和 Randomized 场景下分别取得95.8分和96.1分,均位列第一;在 WorldArena 榜单中,以63.77的总体EWM Score位列第一,并在运动质量、运动流畅性等多个关键维度取得领先成绩。
从理解世界、预测世界到行动于世界,世界动作模型 Motubrain 正推动具身智能从单点能力走向通用能力、从演示验证走向真实应用。
![]()
03 从模型创新走向产业现场
从 Vidu 到 Vidu S1,再到 Motubrain,生数科技在本次 WAIC 呈现了一条从数字世界生成到物理世界行动的技术与产品路径。
通用世界模型不仅意味着更强的内容生成能力,也代表一种能够理解环境、建模规律、预测变化并作出行动的新型通用智能底座。
当前,AI 正在重构内容生产、软件工具、工业流程与智能终端,世界模型也正在从前沿研究走向可体验、可验证、可落地的产品与应用。
WAIC 2026虽然已经落幕,但世界模型走进产业的探索仍在继续。
未来,生数科技将持续推进通用世界模型的研发与应用,推动模型能力深入数字内容、实时交互、具身智能及更多真实场景,进一步释放人类创造力与生产力,引领 AGI 新纪元。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.