网易首页 > 网易号 > 正文 申请入驻

OpenAI发布文生视频模型Sora:60秒一镜到底、吊打现在所有视频生成模型

0
分享至


卷疯了卷疯了,短短十几小时内,OpenAI和谷歌接连发布核弹级成果。

国内还没睡的人们,经历了过山车般的疯狂一晚。

就在刚刚,OpenAI突然发布首款文生视频模型——Sora。简单来说就是,AI视频要变天了!

它不仅能够根据文字指令创造出既逼真又充满想象力的场景,而且生成长达1分钟的超长视频,还是一镜到底那种。

Runway Gen 2、Pika等AI视频工具,都还在突破几秒内的连贯性,而OpenAI,已经达到了史诗级的纪录。

60秒的一镜到底,视频中的女主角、背景人物,都达到了惊人的一致性,各种镜头随意切换,人物都是保持了神一般的稳定性。


01Sam Altman 疯狂安利

OpenAI究竟是怎么做到的?根据官网介绍,「通过一次性为模型提供多帧的预测,我们解决了一个具有挑战性的问题。」

显然,这个王炸级技术有着革命般的意义,连Sam Altman都沉迷到不能自拔!

他不仅疯狂发推安利,而且还亲自下场为网友生成视频:你们随意来prompt,我一一输出。


一位戴着尖顶帽,身披绣有白色星星的蓝色长袍的巫师正在施法,他的一只手射出闪电,另一只手中拿着一本旧书。


在一间拥有电影级灯光设置的充满托斯卡纳乡村风情的厨房里,一位擅长利用社交媒体的奶奶,正在教你制作美味的自制诺奇面。


我们将带你进行一次未来城市的街头巡览,在这里,高科技与自然和谐共处,展现出一种独特的赛博朋克风格。 这座城市洁净无瑕,到处可见的是先进的未来式有轨电车、绚丽的喷泉、巨型的全息投影以及四处巡逻的机器人。 想象一下,一个来自未来的人类导游正带领一群好奇的外星访客,向他们展示人类极致创造力的结晶——这座无与伦比、充满魅力的未来城市。

02多项技术破纪录

借助于对语言的深刻理解,Sora能够准确地理解用户指令中所表达的需求,把握这些元素在现实世界中的表现形式。

也因此,Sora创造出的角色,能够表达丰富的情感!

它所制作出的复杂场景,不仅可以包括多个角色,还有特定的动作类型,以及对对象和背景的精确细节描绘。

看,下图中人物的瞳孔、睫毛、皮肤纹理,都逼真到看不出一丝破绽,完全没有AI味儿。

从此,视频和现实究竟还有什么差别?!


Prompt: Extreme close up of a 24 year old woman’s eye blinking, standing in Marrakech during magic hour, cinematic film shot in 70mm, depth of field, vivid colors, cinematic

此外,Sora还能在同一视频中设计出多个镜头,同时保持角色和视觉风格的一致性。

要知道,以前的AI视频,都单镜头生成的。

而这次OpenAI能在多角度的镜头切换中,就能实现对象的一致性,这不得不说是个奇迹!

这种级别的多镜头一致性,是Gen 2和Pika都完全无法企及的……

举个例子:「雪后的东京熙熙攘攘。镜头穿过繁忙的街道,跟随着几位享受着美丽雪景和在附近摊位购物的人们。美丽的樱花瓣伴随着雪花在风中飘舞。」

Sora根据这个提示所呈现的,便是东京在冬日里梦幻的一幕。

无人机的镜头跟随一对悠闲散步的情侣穿梭在街道上,左侧是车辆在河岸路上行驶的声音,右侧是顾客在一排小店之间穿梭的景象。


Prompt: Beautiful, snowy Tokyo city is bustling. The camera moves through the bustling city street, following several people enjoying the beautiful snowy weather and shopping at nearby stalls. Gorgeous sakura petals are flying through the wind along with snowflakes.

可以说,Sora的效果已经领先到了恐怖的级别,完全跳出了用冷兵器短兵相接的时代,其他AI视频被彻底干趴。


03世界模型成真了?

最最最可怕的一点来了,Sora身上,竟已经有了世界模型的雏形?

通过观察大量数据,它竟然学会了许多关于世界的物理规律。

下面这个片段太令人印象深刻了:prompt中描绘了「一个短毛绒怪物跪在一支红蜡烛旁的动画场景」,同时描述了怪物的动作和视频的氛围。

随后,Sora就创造了一个类似皮克斯作品的生物,它似乎融合了Furby、Gremlin和《怪兽公司》中Sully的DNA。

让人震惊的是,Sora对于毛发纹理物理特性的理解,准确得令人惊掉下巴!

想当初,在《怪兽公司》上映时,皮克斯为了创造出怪物在移动时超级复杂的毛发纹理,可是费了好大一番功夫,技术团队直接连肝几个月。

而这一点,Sora轻而易举地就实现了,而且从没有人教过它!

「它学会了关于 3D 几何形状和一致性的知识,」项目的研究科学家Tim Brooks表示。

「这并非我们预先设定的——它完全是通过观察大量数据自然而然地学会的。」


Prompt: Animated scene features a close-up of a short fluffy monster kneeling beside a melting red candle. The art style is 3D and realistic, with a focus on lighting and texture. The mood of the painting is one of wonder and curiosity, as the monster gazes at the flame with wide eyes and open mouth. Its pose and expression convey a sense of innocence and playfulness, as if it is exploring the world around it for the first time. The use of warm colors and dramatic lighting further enhances the cozy atmosphere of the image.

得益于DALL·E 3所使用的扩散模型,以及GPT-4的Transformer引擎,Sora不仅能够生成满足特定要求的视频,而且能够展示出对电影拍摄语法的自发理解。

这种能力体现在它对讲故事的独特才能上。

例如,在一个以「色彩缤纷的鱼类和海洋生物充斥的,由纸艺精心构建的珊瑚礁世界」为主题的视频中,项目研究员Bill Peebles指出,Sora通过其摄影角度和拍摄时机,成功地推进了故事的发展。

「视频中实际上发生了多次镜头转换——这些镜头并非后期拼接而成,而是模型一气呵成地生成的,」他解释道。「我们并没有特别指令它这么做,它却能自动完成。」


Prompt: A gorgeously rendered papercraft world of a coral reef, rife with colorful fish and sea creatures.

不过,当前的模型并不完美。它在模拟复杂场景的物理效果上可能会遇到难题,有时也难以准确理解特定情境下的因果关系。比如,某人吃掉饼干的一部分后,饼干可能看起来仍然完整无损。



此外,模型在处理空间细节,如区分左右时可能会出错,也可能在描述随时间变化的事件,如特定的摄影机动作轨迹时,表现不够精确。



好在,它还并不完美。

否则,虚拟和现实的界限,还能区分得清吗?


这不是现实?

但是无可否认的是,可怕的事实已经就在面前:一个已经能够理解和模拟现实世界的模型,也就意味着AGI已经不远了。

04「唯一真正的视频生成工作」

业内大佬张启煊评价道,「Sora是我目前看到唯一跳脱出空镜头生成、真正的视频生成工作。」

在他看来,目前看来Sora跟Pika、Runway是有代差的,视频生成领域终于被OpenAI支配。或许某天3D视频领域,有朝一日也能体会到这种恐惧。

网友们都被震惊到失语:「下一个十年会是疯狂的十年。」


「都结束了,我的饭碗要丢了。」


「整个素材行业都会随着这篇成果的发布而消亡……」


OpenAI就是没法停下干死初创公司的脚步,是吗?


「好莱坞即将发生核爆」。


AI电影制作人和他们目前的项目。


05技术介绍

Sora是一种扩散模型,它能够通过从一开始看似静态噪声的视频出发,经过多步骤的噪声去除过程,逐渐生成视频。

Sora不仅能够一次性生成完整的视频,还能延长已生成的视频。

通过让模型能够预见多帧内容,团队成功克服了确保视频中的主体即便暂时消失也能保持一致性的难题。

与GPT模型类似,Sora采用了Transformer架构,从而实现了卓越的性能扩展。

OpenAI把视频和图像分解为较小的数据单元——「patches」,每个「patches」相当于GPT中的一个「token」。

这种统一的数据表示方法能够在更广泛的视觉数据上训练扩散Transformer,覆盖了不同的持续时间、分辨率和纵横比。

Sora基于DALL·E和GPT模型的研究成果,采用了DALL·E 3的重标注技术,通过为视觉训练数据生成详细描述的标题,使模型更加准确地遵循用户的文本指令生成视频。

除了能根据文本指令生成视频外,这款模型还能将现有的静态图像转化成视频,精确细致地赋予图像中内容以生动的动画。模型还能扩展现有视频或补全缺失的帧。

Sora为理解和模拟现实世界的模型奠定了基础,对此OpenAI认为这是实现通用人工智能(AGI)的重要步骤。

06大佬猜测:游戏引擎加持?

Pytorch联合创始人Soumith Chintala猜测道,「根据Sam Altman发布的所有用户请求视频,Sora似乎是由游戏引擎提供支持,并为游戏引擎生成作品和参数」。


英伟达高级科学家Jim Fan对全新Sora模型,发表了一些自己的观点:

Sora是一个数据驱动的物理引擎。它是对许多世界的模拟,无论是真实的,还是虚构的。该模拟器通过去噪和梯度学习方式,学习了复杂的渲染、「直观的」物理、长期推理和语义理解。

如果Sora使用虚幻引擎5接受过大量合成数据的训练,我不会感到惊讶的。必须如此!


同样,爱丁堡大学的博士生Yao Fu表示,「生成式模型学习生成数据的算法,而不是记住数据本身。就像语言模型编码生成语言的算法(在你的大脑中)一样,视频模型编码生成视频流的物理引擎。语言模型可以视为近似人脑,而视频模型近似物理世界」。


07作品欣赏

一列火车穿越东京郊区时,窗户上反射出的迷人景象。


Prompt: Reflections in the window of a train traveling through the Tokyo suburbs.

在雪地草原上,几只巨大的羊毛猛犸象缓缓前行,它们长长的毛皮在微风中轻轻飘扬。远处是雪覆盖的树木和雄伟的雪山,午后的阳光穿透薄云,给这个场景增添了一抹温暖的光彩。低角度的拍摄令这些庞大的毛茸茸动物显得尤为壮观,景深效果引人入胜。


Prompt: Several giant wooly mammoths approach treading through a snowy meadow, their long wooly fur lightly blows in the wind as they walk, snow covered trees and dramatic snow capped mountains in the distance, mid afternoon light with wispy clouds and a sun high in the distance creates a warm glow, the low camera view is stunning capturing the large furry mammal with beautiful photography, depth of field.

无人机从空中俯瞰大苏尔加雷角海滩附近的崎岖悬崖,海浪冲击着岩石,形成白色的浪尖,落日的金色光辉照亮了岩石海岸。远处有一个小岛上立着灯塔,悬崖边缘覆盖着绿色植被。从道路到海滩的陡峭下降和悬崖边缘凸出的景象,展现了海岸的原始美丽和太平洋海岸公路的崎岖风景。


Prompt: Drone view of waves crashing against the rugged cliffs along Big Sur’s garay point beach. The crashing blue waters create white-tipped waves, while the golden light of the setting sun illuminates the rocky shore. A small island with a lighthouse sits in the distance, and green shrubbery covers the cliff’s edge. The steep drop from the road down to the beach is a dramatic feat, with the cliff’s edges jutting out over the sea. This is a view that captures the raw beauty of the coast and the rugged landscape of the Pacific Coast Highway.

蓝色时刻下的圣托里尼岛航拍视图,展现了白色基克拉迪建筑和蓝色圆顶的绝美建筑。火山口的景色令人叹为观止,灯光营造出一种美丽而宁静的氛围。


Prompt: Aerial view of Santorini during the blue hour, showcasing the stunning architecture of white Cycladic buildings with blue domes. The caldera views are breathtaking, and the lighting creates a beautiful, serene atmosphere.

一位20多岁的年轻人坐在天空中的一朵云上,沉浸在书本中。


Prompt: A young man at his 20s is sitting on a piece of cloud in the sky, reading a book.

一群活泼的金毛寻回犬小狗在银白色的雪地上嬉戏,它们好奇的小脑袋时而从雪地中探出,被雪花点缀,萌态十足。


Prompt: A litter of golden retriever puppies playing in the snow. Their heads pop out of the snow, covered in.

在意大利布拉诺一排排鲜艳的彩色建筑中,一只可爱的斑点狗正通过窗户好奇地望向外面。与此同时,街道上人来人往,有的步行,有的骑行。


Prompt: The camera directly faces colorful buildings in burano italy. An adorable dalmation looks through a window on a building on the ground floor. Many people are walking and cycling along the canal streets in front of the buildings.

一幅充满工人、设备和重型机械的建筑工地的移轴摄影。


Prompt: Tiltshift of a construction site filled with workers, equipment, and heavy machinery.

在一个培养皿中,生长着一片竹林,其中小熊猫们在欢快地奔跑。


Prompt: A petri dish with a bamboo forest growing within it that has tiny red pandas running around.

一只卡通袋鼠正在迪斯科舞池中跳舞。


Prompt: A cartoon kangaroo disco dances.

在一杯咖啡中,两艘海盗船展开了激烈的战斗,超写实的近景视频。


Prompt: Photorealistic closeup video of two pirate ships battling each other as they sail inside a cup of coffee.

参考资料:

https://twitter.com/OpenAI/status/1758192957386342435

https://twitter.com/sama

https://openai.com/sora

如果你关注大模型领域,欢迎扫码加入我们的大模型交流群,来一起探讨大模型时代的共识和认知,跟上大模型时代的这股浪潮。


转载原创文章请添加微信:geekparker

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
德国总理宣布犯有严重罪行移民将被驱逐回原籍国

德国总理宣布犯有严重罪行移民将被驱逐回原籍国

财联社
2024-06-06 17:48:07
国足客场死磕韩国的23人名单敲定,王大雷+高天意无缘,武磊回归

国足客场死磕韩国的23人名单敲定,王大雷+高天意无缘,武磊回归

罗掌柜体育
2024-06-07 16:00:36
实探搬迁风暴中的周大福深圳工厂:裁员早有征兆,原本五六百人的工厂现在剩下几十个人

实探搬迁风暴中的周大福深圳工厂:裁员早有征兆,原本五六百人的工厂现在剩下几十个人

华夏时报
2024-06-07 11:01:11
六年级学生的身高真神奇,大的大小的小,就像一家三口,评论笑死

六年级学生的身高真神奇,大的大小的小,就像一家三口,评论笑死

滑稽斑马呀
2024-06-07 14:18:46
8000万年薪!巴特勒超越布朗,排队向火箭道歉吧,哈登还蒙在鼓里

8000万年薪!巴特勒超越布朗,排队向火箭道歉吧,哈登还蒙在鼓里

小宸宸混奖
2024-06-07 11:24:22
媒体人:拜合拉木和张玉宁的身材,就是中国队相对泰国唯一的优势

媒体人:拜合拉木和张玉宁的身材,就是中国队相对泰国唯一的优势

直播吧
2024-06-06 21:57:56
曝CBA将改为每节10分钟!媒体人质疑:联赛不是为国家队服务

曝CBA将改为每节10分钟!媒体人质疑:联赛不是为国家队服务

橙汁的味道123
2024-06-06 17:22:23
内部人爆料南京工厂将停产,上汽大众再度关停工厂?

内部人爆料南京工厂将停产,上汽大众再度关停工厂?

先锋生活大队长
2024-06-07 13:28:06
笑不活了!老板看王心凌演唱会发了8条朋友圈,被笑话了两天!

笑不活了!老板看王心凌演唱会发了8条朋友圈,被笑话了两天!

有趣的羊驼
2024-06-06 14:25:48
尴尬!周鸿祎节目现场,哪吒L引擎盖被一屁股坐塌,评论区炸锅

尴尬!周鸿祎节目现场,哪吒L引擎盖被一屁股坐塌,评论区炸锅

钱多多多多
2024-06-07 09:08:35
原来他早已离世!生前一天吃十几片止疼药,20天被死神带走

原来他早已离世!生前一天吃十几片止疼药,20天被死神带走

代军哥哥谈娱乐
2024-06-05 10:51:32
莫丽被查,曾任南宁海关二级巡视员

莫丽被查,曾任南宁海关二级巡视员

新京报
2024-06-07 11:07:25
大陆中止让利后,台当局突然迎来外援,赖清德总算抓到救命稻草?

大陆中止让利后,台当局突然迎来外援,赖清德总算抓到救命稻草?

莫将离
2024-06-06 22:43:33
63岁奕姐身份被扒?北京住别墅开豪车和摩托,一家人说话客气

63岁奕姐身份被扒?北京住别墅开豪车和摩托,一家人说话客气

察颜观生活事
2024-06-06 15:36:55
打破吉尼斯纪录!6只股票25个一字跌停,没有开板的意思还在继续

打破吉尼斯纪录!6只股票25个一字跌停,没有开板的意思还在继续

惜别的海岸
2024-06-07 10:44:42
浙江“八十万”绿帽门!“娇妻”交往十多个男友,未婚夫变小丑

浙江“八十万”绿帽门!“娇妻”交往十多个男友,未婚夫变小丑

文雅笔墨
2024-06-07 12:53:47
汪小菲一双儿女引担忧!小玥儿催爸爸在台湾买房,连地点都看好了

汪小菲一双儿女引担忧!小玥儿催爸爸在台湾买房,连地点都看好了

元气少女侃娱乐
2024-06-07 13:51:24
决胜6-1,石宇奇大逆转晋级四强!奥运冠军接连失利,国羽4胜2负

决胜6-1,石宇奇大逆转晋级四强!奥运冠军接连失利,国羽4胜2负

求球不落谛
2024-06-07 17:05:38
徐超,被查!

徐超,被查!

鲁中晨报
2024-06-07 10:35:04
俄罗斯没有受邀出席纪念诺曼底登陆活动!普京:我们竟成为局外人

俄罗斯没有受邀出席纪念诺曼底登陆活动!普京:我们竟成为局外人

新时光点滴
2024-06-07 00:54:58
2024-06-07 18:40:49
FounderPark
FounderPark
关注AI创业,专注和创业者聊真问题
163文章数 10关注度
往期回顾 全部

科技要闻

6家大模型抢答高考作文,谁是你心中的Top1

头条要闻

13岁智残女孩遭性侵 10岁弟弟敲门时看见男子提裤跑出

头条要闻

13岁智残女孩遭性侵 10岁弟弟敲门时看见男子提裤跑出

体育要闻

优势在我?中国足球有自己的节奏

娱乐要闻

汤唯抵达巴黎将担任奥运火炬手

财经要闻

身陷退市股的投资者:我的钱瞬间没了

汽车要闻

2.0T混动售20.98万元起 福特蒙迪欧运动版上市

态度原创

教育
房产
健康
公开课
军事航空

教育要闻

一个有用的高考志愿填报方法

房产要闻

顶流地段+顶级户型!香港半山豪宅,已成为高净值人群的资产压舱石!

晚餐不吃or吃七分饱,哪种更减肥?

公开课

近视只是视力差?小心并发症

军事要闻

俄罗斯核潜艇将罕见访问古巴 古方强调"未携带核武器"

无障碍浏览 进入关怀版