来源:市场资讯
服贸会专题活动“2026中国AIGC创新应用交流会”于9月10日在北京举办,主题为“智启未来 应用无界——从模型创新到场景落地”,智象未来(HiDream.ai)联合创始人兼COO王科出席并演讲。
![]()
以下为演讲实录:
尊敬的各位领导、各位来宾,非常感谢主办方的邀请,我是来自智象未来的王科。
我今天分享的主题是《原生全模态重塑AIGC:视频生成进入“单反级交付”时代》。
我们先来看一下AI的演进趋势。很多大模型包括Fable 5、GPT5.6,它已经超过了平均的人类的智力,顶级的模型进入到人类的天才区。大模型沿着两条路线发展:一条是基础语言的大语言模型,依据上下文深度思考。国外以 OpenAI、Anthropic、Google 为代表,国内的企业有包括智谱、DeepSeek 等;另一条是多模态大模型,以智象未来为代表。而从多模态路线,从技术趋势来看,正经历一场从多模态到全模态的进化。最终会走向哪里?我们判断,它将走向世界模型,再从世界模型走向 AGI。
通往AGI,业界存在三条路径:第一条,以李飞飞为首的 3D 原生模型,例如 Marble、HY-World 等;第二条,以具身模型,从 VLA 到 WAM 的架构;我们走的是中间这条路径,即多模态到原生全模态模型,再到 World Model。
智象是全球领先的多模态大模型创新企业。是国内唯一有院士领衔,具备完整的路径和产业经验的多模态的AI团队。
我们取得了很多成绩:是开源图片生成模型 TOP1,月消耗 4 万亿 Token,开源模型累计下载数2百万次,拥有全球 7000 万个人用户,且主要为专业个人用户;SMB 客户超过 4 万家。
智象打造了原生全模态(UiT)底层架构,实现世界表征的统一。我们身处的世界,本质上是一个多模态的世界。如果想要去imagine world的话,一定是以图像为起点。我们常说叫一图胜千言,因为图像定格了世界某一时刻的完整状态痕迹。以静态图像为基点,加上时序便成为视频,加上立体几何便成为空间,再加上操作交互便成为具身智能。因此,我们认为图像是未来世界模型的入口。
UiT能实现所有模态从原始信号端到端的对齐,实现any to any,也就是任意输入和任意输出。
基于 UiT,我们构建了 HiDream‑O1 原生全模态世界模型矩阵。其中包括图像模型HiDream‑O1‑Image 、视频模型HiDream‑O1‑Video、交互式世界模型HiDream‑O1‑World、具身世界模型HiDream‑O1‑Embodied。
这不是简单的功能叠加,而是从底层打通图像、视频、3D、动作等全部模态,实现从 理解 → 推演 → 执行 的完整闭环。
我们的模型有三份不同赛道的硬核成绩单。
HiDream‑O1‑Image‑1.5 图像生成模型,在国际独立评测平台 Artificial Analysis 文生图榜单中,取得中国第一、全球第二的成绩;开源版本也取得了世界第二的成绩。
交互式世界模型 HiDream‑O1‑World,在行业首个交互式世界模型基准 WBench,综合总榜第一。尤其在物理规律还原、长时序内容一致性两大核心难点指标表现突出。
具身世界模型 HiDream‑O1‑Embodied,在 RoboColiseum子榜单中登顶。在非理想环境中的稳定性与泛化能力上, HiDream‑O1‑Embodied表现出色。这几款模型分别在各自赛道拿到权威榜单的顶尖位置,这不是单点模型的偶然突破,而是整套 UiT 原生全模态底座体系化能力的集中体现。
为什么我们要在这条路上持续创新?背后是我们对AI发展趋势的一个判断。
大语言模型和多模态模型,让AI能理解文字、图像、视频,回答“世界是什么”。
但世界模型要再往前走一步——它要回答:
世界会怎么变化?如果我采取一个行动,会产生什么结果?
所以世界模型不是简单的生成模型,它是AI的认知内核。它要做三件事:
感知世界状态,推演物理规律和因果关系,然后重构并预测世界。
而智能体是行动载体,负责决策、执行、调用工具、观察反馈,并在反馈中不断修正。
用一句话概括就是:基础模型负责认知,智能体负责行动,闭环反馈负责进化。
有了基础模型和智能体的结合,AI才能从“理解世界”走向“改变世界”。
我们不仅在模型上持续迭代,也在形成清晰的商业化增长曲线。
我们打造了“1+1+3”全景式商业体系。它的底层是 HiDream-O1 原生全模态世界模型,包括图像模型、视频模型、交互式世界模型和具身世界模型能力。
中间是企业级模型服务平台,把模型能力封装成可调用、可管理、可评估、可交付的平台能力。
上层是三个场景化产品:
面向内容电商和品牌商家的 AI 营销生产平台;
面向影视创作的内容创作协作平台--帧赞;
面向全球创作者的视频创作工具 vivago。
我们不是只做一个模型,也不是只做一个工具,而是以模型能力为底座,以平台能力为中台,以场景化产品实现商业落地。
我们先来看第一个产品,全球首个专业级的AI影视创作智能体——帧赞。最近芒果台播出了一个《西游记》的AI电视剧,广受好评。未来我们判断所有的AI剧都要朝着精品化去做。近期基于帧赞,有创作团队打造了《青铜诡事录》的电视剧,用30天的时间制作了60集,这是首部AI短剧12小时登顶腾讯热播的榜首,此外还有像《雨夜突袭》、《决战巨兽》、《热血追击》等精品短剧,已经在各大平台播放。
帧赞是为专业团队而生,覆盖从创意到成片的全链路,包含角色库、场景库、服化道等。凭借画布、专业分镜等功能,能代替现场拍摄。影视制作中,剪辑是一个重要环节。帧赞支持快速搭片,以快速节奏高效输出,同时还可以输出无限创意。另外,在整个制片管理上。帧赞提供全流程项目管理,可以根据预算跟踪每个人的消耗、每个人的效率。而且还能实现资产沉淀,也可以做 IP 运营。整套系统就是为商业落地、为专业团队服务。目前帧赞服务的专业团队超过几千家。
再看商业营销方向。
我们的商业营销智能体HiBurst,已经覆盖了跨境电商内容营销、媒体运营和应用出海等场景,现在是TikTok官方Top 5服务商,年生产电商营销视频超过百万条。它可以从脚本生成到剪辑成片一体化生成,可以兼顾个人创作与多人协作,同时能够精细化分镜,以及嵌入平台一键发布。
第三个场景应用,也就是今天要重点介绍的是,行业内首个无限时长内容创作智能体vivago R1。依托我们“基础模型+智能体”双轮驱动的技术战略,R1支持用自然语言对话的方式生成视频,一次性就能稳定生成五分钟的高质量内容。
这意味着每一位普通创作者,都能独立完成专业团队级的品质作品,我们称之为“单反级交付”。
在2024年5月就上线了vivago.ai,是全球最早一批公开可用的AI视频生成产品之一。
今年5月,它登顶了Product Hunt日榜第一。7月20号,我们在WAIC上正式发布了R1。
而今天,我想向大家宣布——R1正式全球上线,同时国内版本‘够搭’也迎来全新升级发布。
当前AI视频工具大致有两条路线。一条是画布式工作流,把模型、工具和参数交给用户自己连接调试,自由度很高,但门槛也不低。另一条是R1选择的对话式路线——用户只需要用自然语言描述需求,就能自动生成视频,并且在对话中持续调整和迭代。
我们相信,对话是人类最自然的表达方式,也是AI最友好的创作入口。所以R1坚定地选择Chat-First,对话优先。
这条路线背后体现了智象的两个产品设计理念——“做后”与“做厚”。
“做后”,是把专业创作者的判断、审美和经验,编码进Agent的编排能力里,形成强大的中后台。
“做厚”,是构建一个厚度十足的SkillHub,把抽象的AI能力翻译成产品广告、角色视频、故事短片、品牌内容这些真实创作场景,让用户一看就知道能做什么、怎么开始。
整个流程里,用户只需要表达目标,Agent负责拆解和执行,SkillHub作为翻译层,自动匹配并编排所需的技能组合,把意图转化为可执行的任务序列。
用户只需要用自然语言描述,就可以自动生成视频,门槛低、成本非常低,而且稳定可控。
最后,我想说,技术能力要持续迭代,离不开产业生态的共建。
智象未来在四个方向进行生态布局。
底层基础设施上,智象对接了火山引擎、阿里云、华为云、腾讯云等云厂商。
互联网营销方面,与TikTok、SHEIN等海内外平台深度协同。
影视文旅领域,联动上影股份、湖北长江电影集团等广电影视机构。
具身智能方向,联合机器人企业,打造毫米级物理精度的大规模全模态数据集。
我们不仅有很多国际知名大企业合作,很多中小商家也是非常重要的生态伙伴。我们期待与各界伙伴携手,共同推动原生全模态 AIGC 技术赋能千行百业,共创内容产业的全新未来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.