网易首页 > 网易号 > 正文 申请入驻

从生成内容到创造体验,多模态大模型如何改变内容生产?

0
分享至

转载自“infoQ”公众号

“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情,无法阻挡。”执导《可可西里》《南京!南京!》的导演陆川说。

今年云栖大会,陆川使用阿里巴巴多模态模型,制作了短片《历史·现场》,复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作,这次团队只用了 5 天。陆川甚至评价,模型对上下文的理解“已经达到‘博士后’的水平,超过 80% 以上的普通人”。

支撑陆川这类专业创作实践的,是过去一年多模态生成能力的持续提升。沿着技术演进继续往前看,两条路径尤其明显。

首先,从单模态生成走向多模态融合生成。对于视频而言,模型不仅可以联合处理画面与声音,参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图,开始通过更直接的多模态信息传递给模型,生成因此更加一致和可控。

其次,从生成内容走向创造体验。随着生成时长增加、速度提升,视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入,根据新的状态生成后续内容,由此进入游戏、互动内容和仿真等新的应用空间。

这两条路径,也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6,已经支持智能分镜调度、参考生视频、多角色一致性等能力,视频生成开始从文生视频、图生视频,走向由更多参考信息共同控制的创作。今年 4 月,Happy Horse 1.0 进一步采用单流 Transformer,原生联合生成音频和视频。整个第一梯队的视频模型,也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。

技术能力的提升,也在改变内容生产本身。AI 已经开始进入越来越多专业工作流,成为内容生产的新基础设施。


承接此前在多模态领域的积累,今年云栖大会,阿里巴巴进一步更新了多模态生成模型家族。

此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE(智能体式创作引擎)。新一代视频生成模型也将在今年 11 月发布。


与此同时,阿里巴巴还公布了对未来多模态模型的技术判断。

阿里巴巴 ATH 技术副总裁,淘天集团首席科学家郑波在云栖大会现场提到, 三年内会出现一个原生全模态统一模型,体验将不再受限于模态的边界。

1 图片,从“生成图片”走向视觉生产

过去两年,图像生成模型的画质、审美和真实感快速提升。但进入生产场景,一张图片好看还不够。创作者需要稳定、可控地完成任务,而不是反复“抽卡”,靠概率碰出一张能用的图。

这对图像模型提出了更具体的要求:信息要准确,排版要考究,专业内容要理解,生成结果最好能直接使用。


今年云栖大会上,阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例,解释了生产力图像模型需要解决的问题。


科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片,但前提是作者核验内容准确性,并明确披露 AI 的使用。在这个领域,AI 生成内容的准确性和对专业知识的理解,对于研究人员来说至关重要。2024 年,《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文,其中出现了严重失真的大鼠解剖结构和错误标注。

因此,面对学术原理图,模型需要实现“世界知识的渲染”:先理解复杂的科学原理,再将概念、流程和关系准确呈现出来。图画得像不像,只是其中一个要求;知识有没有表达错,才决定它能不能进入科研生产。


营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材,一张图片往往同时包含商品、文字、图示和版式。

现场以“一杯咖啡的风味之旅”为主题,展示了 Qwen-Image-3.1 生成的图片。可以看到,模型能够同时处理中文标题、小字、图示和段落,并将不同信息组织出清晰的视觉层级,让读者一眼抓住重点。


影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频,前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜,需要把剧情进一步转换成具体的画面和镜头。给出一段剧情,Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本,为后续视频生成提供更明确的视觉参考。

而生产力图像还有一个重要要求:模型需要理解一张图片在不同层级上的结构。



同一张人物照片,创作者可能只想修改其中一个对象,也可能需要提取轮廓、重新设计版式;再往后,还可能希望从单张正面照片生成不同角度的角色,甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境,对图像的理解层级也随之加深。

Qwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力,分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示,“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑,已经不只是对生成结果进行局部修改,也包括从已有图像中理解和提取结构,再沿着不同维度重新组织和生成内容。

从科研图示、营销图片到电影分镜,这些生产任务最终指向的是同一个要求:减少随机性,增加确定性。


当模型能够准确理解信息,并围绕已有视觉资产继续组织和生成内容,图像生成才真正走向生产。

2 真正理解“审美”的音乐生成模型


AI 音乐供给快速增长,完整歌曲的生成能力早已不再稀缺。现在,行业开始更关注专业可控性,以及更难量化的音乐品质:审美、旋律、人声和情绪表达。


音乐的特殊之处也在这里。图像是否准确,可以从文字、物体、空间关系等维度验证;音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳,人声是否自然,情绪是否准确,编曲是否符合特定文化和音乐类型的审美,很难依靠传统 Benchmark 完整衡量。

今年云栖大会发布的 Happy Shrimp 1.1,进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前,模型覆盖百余种曲风和十余种主流语言,可以生成人声歌曲和纯音乐。相比 1.0,1.1 的旋律记忆点更强,人声唱法和情绪表达更加丰富,对复杂创作指令的理解进一步提升,多语言演唱的发音也更加准确、清晰。

在大会现场,郑波展示了 Happy Shrimp 1.1 生成的多首作品。

不同语言下,模型都能较为清晰地完成人声演唱,并按照要求处理曲风和情绪。

如何让模型更好地理解创作意图,理解容易被主观意义影响的“好听”?

Happy Shrimp 1.1 引入了 音乐审美建模与强化学习,将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说,音乐性本身开始成为模型的优化目标。

这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点,让主题能够在重复、变化和再现中保持辨识度;编排则进一步处理配器、声部和律动,让主歌、副歌、桥段等不同部分承担各自的段落功能,推动整首作品的情绪发展。

在人声生成上,准确只是基础,唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度,也增加了唱法和情绪表达

的丰富度。目前,模型覆盖百余种曲风和十余种主流语言。

但“好听”没有一套统一标准。不同年代、文化和音乐类型,都有各自的旋律、配器、律动和演唱习惯。除了音乐审美,模型还需要把创作者相对抽象的描述,转换成具体的音乐选择。


比如用户只给出“雨夜返乡,克制的喜悦”,模型需要判断什么样的曲风和配器符合对应的文化语境,什么样的唱法适合这种情绪,律动应该有多强,段落又应该如何展开。

Happy Shrimp 1.1 通过世界知识增强音乐理解与生成,将文化语境和场景意图进一步对应到曲风、音色、律动和结构。


除了理解音乐本身,真正面向创作的模型,还要理解不同创作者需要什么。


对于普通用户,目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp(快乐虾米)里,用户可以从一句想法开始,描述故事、情绪和风格,生成一首人声歌曲或纯音乐;歌词可以自己写,也可以由 AI 辅助完成。

专业音乐人的需求则不同。他们需要保留自己的创作判断,并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后,还需要继续修改、比较和选择版本。

Happy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律,用 B 的编曲风格与 C 的音色重新演绎”;局部修改副歌鼓组时,则只增强鼓组的冲击力,同时保护旋律、人声和其他段落。

这让创作者能够继续修改和加工生成结果,而不是反复抽卡,被迫接受模型的一次性成品。

3 视频,从生成能力走向创作智能

这次发布会上,在预告新一代视频生成模型发布时间的同时,郑波公布了阿里巴巴对视频模型演进方向的判断。

视频模型已经从早期的 DiT 验证阶段,走向多模态参考创作,并开始进入理解创作的阶段。


最早的 DiT 验证阶段,核心是先把视频生成出来,解决生成质量问题。今年上半年开始,多模态参考能力快速演进,模型能够同时理解文字、图片、视频和音频,视频生成也从相对单一的输入走向多模态创作。郑波表示,目前市场上绝大部分用户都已经在使用多模态参考。

而现在,阿里巴巴的视频生成模型正在迈向下一个阶段:在生成素材的同时,进一步理解创作目标和创作意图。


模型需要更懂叙事和镜头,能够从一个想法、一个故事出发,自动拆解剪辑和分镜,组织角色与场景,再完成最终生成。再往后,阿里巴巴还在探索将理解、推理、生成和交互进一步统一,让 AI 从生成内容走向理解创作、参与创作和完成创作。

沿着这个方向,阿里巴巴下一代视频模型将会朝“更长、更可控、更完整、更智能” 四个方向提升。

“更长”,是在更长时间里保持人物、场景和内容的一致性,讲完一个完整故事;“更可控”,是让创作者更精确地控制人物、场景、镜头和其他创作元素;“更完整”,是从生成单个镜头走向理解剧情、情绪和完整叙事;“更智能”,则是更好地理解创作意图。

要做到更长、更可控、更完整、更智能,仅靠视频生成模型本身并不够。


一段几秒的视频,还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频,人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置

如何变化,都需要持续控制。并且,除了文本、图片、视频和音频,3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态,也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同,视频生成工具还需处理跨时间的约束、工具调用,以及人物和场景等素材的持续复用。

阿里巴巴因此提出了 Agentic PE(智能体式创作引擎)辅助生成体系,用来组织复杂任务和长时域生成所需的多模态条件。


Agentic PE 先根据生成任务,确定需要哪些控制条件,再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频,以及相机几何信息。对于长时段生成,它还会规划不同时间段的约束,并持续更新条件。为提高效率,它会检索和复用已有素材,并根据任务要求和时延选择控制精度。同时,推理时使用的控制信号需要在模型训练阶段得到支持,才能在生成时发挥作用。


多模态预训练与 Agentic PE 配合,可以让视频在持续生成的过程中保持可控,支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。

对于长视频,持续的条件约束有助于保持前后内容一致,让变化符合创作要求。对于实时流式生成,条件可以随着新输入逐步更新,引导后续画面,实现边生成、边交互。

Agentic PE 辅助生产也未必是最终的架构形态。


阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练,同时保留不同模态的输出头或专家。


4 多模态模型,从内容,到体验

过去几年,图像、音乐和视频生成主要沿着各自的技术路线发展。现在,生成任务正在变得更加复杂:文本之外,图像、视频、音频,以及轨迹、相机参数、3D 几何等信息,都开始成为生成条件。

图片开始从一次生成走向可编辑、可继续生产的视觉资产;音乐开始从生成完整歌曲,走向对旋律、审美和创作意图更细致的控制;视频则开始处理更长的叙事、更复杂的条件,并进一步探索实时流式生成。

更丰富的多模态输入、更完整的创作能力,以及实时生成与交互,正在带着 AI 从生成内容,走向创造体验。

-End-

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
169金89银83铜!中国代表团连续12届亚运会金牌榜第一

169金89银83铜!中国代表团连续12届亚运会金牌榜第一

新华社
2026-10-03 22:31:00
AI数字人面试官引发求职者“恐怖谷效应”吐槽,话题冲上热搜

AI数字人面试官引发求职者“恐怖谷效应”吐槽,话题冲上热搜

IT之家
2026-10-03 16:08:06
发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

阿呆爸
2026-09-27 21:04:44
俄罗斯发出警告,北约回应

俄罗斯发出警告,北约回应

参考消息
2026-10-01 16:10:31
华国锋夫人韩芝俊现年91岁,生活朴素,坚持上下班骑自行车

华国锋夫人韩芝俊现年91岁,生活朴素,坚持上下班骑自行车

旧闻档案馆
2026-10-03 09:30:29
吴石行刑前,据说汤恩伯两次向老蒋求情,蒋说:最多保障家眷周全

吴石行刑前,据说汤恩伯两次向老蒋求情,蒋说:最多保障家眷周全

优趣纪史记
2026-09-30 06:42:21
浙江3名男子嘴馋,下班后忙活两小时抓石蛙,空手后偷走农户4只土鸡,被抓后还委屈:“我来都来了!”

浙江3名男子嘴馋,下班后忙活两小时抓石蛙,空手后偷走农户4只土鸡,被抓后还委屈:“我来都来了!”

励职派
2026-10-03 12:46:17
Google大幅收紧Gemini免费使用权限 免费用户下周起仅可使用Flash-Lite模型

Google大幅收紧Gemini免费使用权限 免费用户下周起仅可使用Flash-Lite模型

cnBeta.COM
2026-10-03 22:11:07
2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

宋鶛搞笑配音
2026-09-21 22:55:09
迪拜航空刺杀案有新进展,副驾驶国籍曝光,过激行动原来早有预兆

迪拜航空刺杀案有新进展,副驾驶国籍曝光,过激行动原来早有预兆

琴音缭绕回
2026-10-03 18:24:17
奔驰新车官宣:10月12日,正式发布

奔驰新车官宣:10月12日,正式发布

科技堡垒
2026-10-03 09:11:16
恩爱12年难抵残酷现实?46岁高圆圆现状曝光,赵又廷的处境太揪心

恩爱12年难抵残酷现实?46岁高圆圆现状曝光,赵又廷的处境太揪心

老塕是个手艺人
2026-09-05 16:14:32
“托下巴的,一看就有钱!”女生宿舍6人照走红,气质天差地别!

“托下巴的,一看就有钱!”女生宿舍6人照走红,气质天差地别!

番外行
2026-10-01 21:39:14
千万不能打美国!听听毛主席是怎么说的!

千万不能打美国!听听毛主席是怎么说的!

小马姨
2026-07-14 13:32:34
你的真实存款会瞒着身边人吗?网友:不要说不要说,一万也不要说

你的真实存款会瞒着身边人吗?网友:不要说不要说,一万也不要说

解读热点事件
2026-10-04 00:17:47
同甘共苦:哈兰德或将被迫在低级联赛为曼城效力

同甘共苦:哈兰德或将被迫在低级联赛为曼城效力

本泽体育
2026-10-03 12:36:43
哈萨比斯嫡系交卷!AI用几天打穿10的60次方化学宇宙,制药业迎「iPhone时刻」

哈萨比斯嫡系交卷!AI用几天打穿10的60次方化学宇宙,制药业迎「iPhone时刻」

新智元
2026-10-03 08:33:09
越治越猖獗!形式主义死灰不灭的真相:从来不是懒,是太“精明”

越治越猖獗!形式主义死灰不灭的真相:从来不是懒,是太“精明”

浪子说
2026-08-10 00:50:03
记者:C罗无法与梅西相提并论,C罗总是食言而梅西信守承诺

记者:C罗无法与梅西相提并论,C罗总是食言而梅西信守承诺

兰亭墨未干
2026-10-03 10:52:07
江苏这辆保时捷流拍了,7.9万没人敢接盘

江苏这辆保时捷流拍了,7.9万没人敢接盘

刘哥谈体育
2026-10-02 07:56:46
2026-10-04 04:40:49
阿里云云栖号
阿里云云栖号
阿里云官方内容社区!
3652文章数 867关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

刚刚拿到绿卡 中国籍夫妻突发车祸身亡

头条要闻

刚刚拿到绿卡 中国籍夫妻突发车祸身亡

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
教育
数码
旅游
军事航空

艺术要闻

何家英作品欣赏

教育要闻

初三倒计时日历,从10月体考备战到明年7月录取每月一件事

数码要闻

开发者将iPhone 17 Pro Max变成MacBook Pro的第二块GPU

旅游要闻

美景添韵味 市集聚烟火 守护保平安

军事要闻

美国被指正向中东派遣第三艘航母

无障碍浏览 进入关怀版