网易首页 > 网易号 > 正文 申请入驻

智谱AI“中国版Sora”实测:6秒视频排队2分钟,猫猫很可爱,人手很翻车

0
分享至


智东西(公众号:zhidxcom
作者香草
编辑李水青

全量上线,免费可用!

智东西7月26日报道,今天一早,大模型独角兽智谱AI正式发布视频生成工具清影,可支持文生、图生6秒时长的视频,即日起在PC端、手机App端以及小程序端面向所有C端用户免费开放

先来看看效果,以下是几个官方放出的文生和图生视频案例,覆盖人像、动物、3D卡通等场景:

从Demo来看,清影的生成效果虽然相比Sora等还有一定进步空间,但就整体而言流畅度、运动幅度等都很不错,无论是人物表情、动作,还是光影变化、镜头移动,都没有明显的卡顿和突兀感,对运动幅度的把控也恰到好处,不会看起来像PPT也不会过于夸张。

此外,虽然生成是完全免费的,但生成视频需要排队,智谱AI提供了两种加速排队的订阅方式,包括5元加速1天、199元加速1年。

清影API今天也同步上线,企业和开发者都可以通过调用API的方式,体验并使用清影的文生、图生视频能力,据称这也是国内上线的首个视频生成API

智谱AI CEO张鹏解读,清影基于自研的底座视频生成模型CogVideoX打造,能将文本、时间、空间三个维度融合起来。该模型参考Sora算法设计,采用了DiT架构,相比前代CogVideo模型推理速度提升了6倍。

智谱AI成立于2019年6月,起源于清华大学计算机系知识工程实验室,专注于开发新一代认知智能大模型。一直以来,智谱AI以对标OpenAI全模型产品线为线索,陆续研发了包括文本、代码、图像、Agent等方面的自研模型和产品矩阵。此次发布基于CogVideoX的清影,使其大模型矩阵又扩充类一个模态。

值得一提的是,这也是国内做语言大模型起家的大模型独角兽,首次推出视频生成产品——之前这个赛道更多的是字节、快手等短视频大厂,以及爱诗科技、生数科技等专注于视频生成模型的创企。

清影具体有哪些特点?其底层模型在哪些方面做了创新?具体效果如何?智东西第一时间上手实测了一番,有以下几点发现:

1、简短的提示词效果更好,复杂指令下会丢失细节。

2、人手仍是重灾区,容易出现画面闪烁的现象。

3、生成很快,但加上排队等待时间仍达到1-2分钟

4、相比图生视频,文生视频的稳定性更高


当然,有限次的体验无法做到全面,也欢迎感兴趣的读者朋友,在评论区分享体验感受和新发现~

一、半分钟生成6秒视频,复杂指令、内容连贯

清影主要有4个特点:生成速度快、复杂指令遵从能力强、内容连贯性高以及画面调度幅度大。

首先在生成速度上,清影AI据称可以在30秒内生成一段6秒、帧率16fps、分辨率1440*960的视频。

▲实时演示视频生成(动图有加速)

其次,在复杂指令遵从能力上,智谱AI自研了视频理解模型,用于为视频数据生成高度吻合的文本描述,进而构建了海量高质量视频文本对,提升了指令遵循度。

▲复杂指令演示

清影的第三个特点是内容连贯性,能够比较好地还原物理世界当中的一些运动的过程。

例如基于这张大家熟悉的杜甫画作,清影让杜甫不仅动了起来,而且非常自然顺滑地端起了一杯咖啡。

▲内容连贯性

最后在画面调度方面,清影采用文本、时间、空间融合的Diffusion Transformer架构,可生成遵循特定运动规则的动态视频。

智谱AI豪迈地放出了几十个Demo,其中不乏有一些效果惊艳,比如这个:木头上长出两朵奇特的透明塑料花

“透明塑料花”不是真实存在的,清影的想象力和审美在这个案例中得以展现。

再比如这个:比得兔开小汽车,游走在马路上,脸上的表情充满开心喜悦,全景画面


清影绘制的兔子表情很丰富,没有出现五官扭曲的情况,前后景别还加了景深处理。

人像案例清影也拿捏住了,比如这个提示词:油画风格,美丽的少女侧颜,光透过树形成斑驳的影子,柔光落在她脸上


整个画面光影对比鲜明,不过漏失了“油画”、“斑驳的影子”等细节。

二、实测上手有惊艳也有翻车,付费加速有些鸡肋

官方演示虽好,但清影到底好不好用,还是得自己试一下才能知道。打开清影网页端,可以看到有文生、图生视频两种功能。


▲清影网页端

文生视频中,我可以选择视频风格,包括卡通3D、黑白老照片、油画等;也可以选择情感氛围,包括温馨和谐、生动活泼、紧张刺激、凄凉寂寞等;运镜方式包括水平、垂直、推近、拉远四种。

图生视频中,我可以为图片添加文字描述,如果不知道写什么也可以空着,或是让系统随机生成一个提示词。


▲两种模式

首先我尝试了一组动物场景的提示词,第一个为:一只蓝猫在猫爬架上,正在吃主人递过来的芝士汉堡,情感氛围选择了温馨和谐。

可以看到,清影准确理解了提示词,整体效果还是很不错的。对于提示词中细节,包括猫的品种、汉堡的种类以及“递过来”的动作等,都表达得比较精准,人手也没有翻车。

第二个提示词为:一只橘猫把鼠标推下桌子,情感氛围为生动活泼。

这次清影表现得一般,鼠标上莫名其妙拴了一只小老鼠就算了,“推下桌子”的动作也是完全没有体现。

前两个提示词都属于写实场景,第三个提示词则有些“魔幻现实”:一只白猫在车里驾驶,穿过繁忙的市区街道,背景是高楼和行人,情感氛围为紧张刺激。


清影对于这个提示词的理解和呈现都还比较准确,背景中动态场景的运动幅度、一致性也比较高,但是稳定性还有所欠缺,画面会出现抖动的情况。

第二组提示词我尝试了人物场景。首先来试试经典的吃面:一个男人坐在桌边吃面条,情感氛围为凄凉寂寞。

在这个经典难题上,清影的表现还算可以,乍一看没什么错误。但细看之下,男人吃面的餐具用的是勺子,面条的形态也有些僵硬。

第二个提示词是:一个女孩坐在米色沙发上,专心地用钩针勾着一顶浅蓝色帽子,情感氛围为温馨和谐。


这条提示词中我加入了色彩的细节,清影都准确地表现了出来。女孩的钩织动作也比较真实,就是人手非常“鬼畜”。

第三个提示词为:漂亮的水色瞳孔特写,写实风格,超清,情感氛围为凄凉寂寞。


清影生成的视频基本上满足了我的预期,不过在特写镜头下,人物的皮肤和毛发都显得有些“油腻”。

最后我尝试了让清影自己生成提示词,它直接整了这么长一段:雨天的咖啡馆,以窗户为媒介拍摄一个英式咖啡馆内部,要清晰的拍摄咖啡馆内部,捕捉咖啡馆内的温馨氛围,然后变焦,对焦在雨滴拍打的窗户上。细节上,注意捕捉顾客们的交谈和笑容,以及雨水在窗户上形成的光影效果,营造出舒适而宁静的氛围。

结果很遗憾,清影自己给自己挖了个坑,生成的不能说是视频,称之为动图都有些为难。画面仅仅是平移放大了一圈,也没能体现提示词中的大部分内容。

体验完文生视频后,我又尝试了图生视频

首先在上传图片时,清影会提醒我对图片进行裁切,且只能裁成进行固定比例的横图,这就造成了一定的局限性。上传图片之后,我输入提示词:花瓣在风中摇动


生成效果还是比较准确的,不过这个提示词本身的难度也不算大。

接着我上传了一张静物图,这次没有输入提示词,看看清影会如何自由发挥。


这张图上有很多独立的物体,清影并没有让它们整体运动而是为每个“小团子”添加了不同动态,整体画面比较生动活泼。

第三张图我上传了一张戴着墨镜的人像,提示词为:男孩把墨镜摘下来

这个提示词的难度很大,而且涉及到“无中生有”的部分。清影成功表现了“摘墨镜”这一动作,不过摘了是摘了,但没完全摘,墨镜还在人脸上挂着,视频后半段还出现了人体不自然的扭曲。

如果不要求它凭空生成人脸又会如何?我有上传了一张举着摄像机的人像照片,提示词改为:男孩转身面向镜头


结果这次清影反而整了个人脸出来,就是没有眼白有些吓人……不过忽略脸的话,这次生成的效果转身幅度更大,人物的头发也随风飘动,就是他手中的器材变了个模样,人手也有些不自然。

一番体验下来,清影生成视频的效果有的惊艳到我,比如第一个小猫吃汉堡的例子,文字理解十分准确;也有的翻车严重,比如咖啡厅、橘猫的例子中,失误都比较大。

整体来看,清影在生成速度上确实比较快,虽然较宣传的30秒还有些偏差,但差不多1分钟左右就能生成视频;在运动幅度、语义理解等方面,会比较看运气,不过这也是所有视频生成工具的通病。与市面上其他公开可用的工具相比,清影在生成时长、清晰度方面还有一定的进步空间,不支持画面比例的选择也是一大遗憾。

值得一提的是,清影目前的视频生成是完全免费的,不需要会员订阅也没有数量限制。不过在排队生成的过程中,清影提醒我可以加速。点击加速的按钮,可以看到它提供了两种订阅方式:5块钱加速1天,或是199元加速1年。


▲加速排队

该说不说,这个价格还是很实惠的,但为啥我加完速排队时间一点也没减少呢……唯一的变化就是,从“排队中”变成了“加速排队中”。可能费用太便宜了,大家都加速就相当于没加速吧(doge)。

三、自研端到端视频模型,首个API同步上线

清影基于智谱AI自研的底层模型CogVideoX打造,具有内容连贯、可控性高等特点。

内容连贯性方面,智谱AI自研了一个高效的三维变分自编码器结构,称之为3D VAE。它能够将原视频空间压缩至2%的大小,大大减少视频扩散生成模型的训练成本和难度,再配合3D RoPE(旋转位置编码)模块,有利于在时间维度上捕捉帧间关系,建立食品中的长程依赖。

可控性方面,智谱AI自研了一个端到端的视频理解模型,用于为海量的视频数据生成详细的、贴合内容的描述文本,从而增强模型的文本理解和指令遵循的能力,使生成视频更符合用户的输入,理解超长的复杂指令。

模型结构上,CogVideoX采用了将文本、时间、空间三个维度全部融合起来的Transformer架构,摒弃了传统的交叉注意力(Cross-Attention)模块,将文本和视频两个不同模态的空间进行对齐,能够更好地进行模态交互。

▲CogVideoX特点

张鹏称,在CogVideoX的研发过程中,智谱AI有一次验证了Scaling Law在视频生成方面的有效性和可靠性,未来团队会在继续扩大数据规模和模型规模的同时,寻找更具突破式创新的模型架构。

智谱AI又一次实现了对OpenAI全模型产品线的对标。

▲智谱AI对标OpenAI全模型产品线

在算力方面,清影是在北京亦庄AI公共算力平台上训练而来的。数据层面,智谱AI与Bilibili、华策影视等进行了合作。

张鹏谈道,虽然视频生成模型才刚刚起步,但已经受到了很多产业和客户侧的需求,涉及电商产品宣传、影视特效等领域。

今天起,清影AI也同步在智谱AI大模型开放平台上线了API,企业和开发者都可以通过调用API的方式体验并使用CogVideoX的文生、图生视频能力,据称这也是国内上线的首个视频生成API。

随着清影能力的加入,智谱AI旗下的AI助手清言App在功能的全面上再下一城,覆盖对话、生图、代码、Agent和视频。

智谱AI还准备了一个One more thing——视频生视频能力。不过准确来说,这相当于是一个手动视频生视频的能力:基于智谱AI近日开源的视频理解模型CogVLM2-Video,用户可以上传视频并提取出详细的文字描述,再将文字输入清影,实现“视频生视频”的效果。

▲视频生视频

结语:又一强力玩家入局AI视频生成

Sora发布后,AI视频生成迎来“第二春”,无论是技术、产品的迭代,还是资本市场的关注,都达到了新的高度。光是本周,就有快手宣布全球上线、爱诗科技发布第二代模型,以及今天智谱AI入局等重磅进展。(视频生成大战2.0!大厂狂卷底层模型,创企5个月吸金44亿)

不同于此前的文本、图像模型赛道,国内长期处于追逐OpenAI等海外企业进展的状态。在视频生成领域,国内的大厂、创企在短短几个月内实现弯道超车,不仅打磨出了高质量的底层模型,而且个个公开可用甚至免费,给至今仍是期货的Sora上了一课。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
张紫妍被潜规则后自杀!曾同时“接待”4位客人,被玩到无法走路

张紫妍被潜规则后自杀!曾同时“接待”4位客人,被玩到无法走路

小徐讲八卦
2026-02-06 18:35:03
不要在冬奥会搞事情!因含政治口号,第3位乌克兰运动员头盔被禁

不要在冬奥会搞事情!因含政治口号,第3位乌克兰运动员头盔被禁

全景体育V
2026-02-12 06:52:52
一个残酷的社交逻辑:底层无贵人,弱者无圈子

一个残酷的社交逻辑:底层无贵人,弱者无圈子

洞见
2026-01-10 21:41:53
1971年台湾退出联合国,毛主席悔叹:不改国名就能顺势将其收复

1971年台湾退出联合国,毛主席悔叹:不改国名就能顺势将其收复

大运河时空
2026-02-10 07:00:03
斯诺克最新战报:中国3胜5负,袁思俊爆冷,丁俊晖输球严重

斯诺克最新战报:中国3胜5负,袁思俊爆冷,丁俊晖输球严重

阿错田间生活
2026-02-12 08:28:45
“冰上F1”的秘密:听雪橇运动员讲如何“巧用力”

“冰上F1”的秘密:听雪橇运动员讲如何“巧用力”

澎湃新闻
2026-02-11 10:19:00
高峰也没想到,他当年抛弃的儿子,如今开始给那英争光了

高峰也没想到,他当年抛弃的儿子,如今开始给那英争光了

趣文说娱
2026-01-04 16:34:24
悲哀的是,国家经济和消费要全靠这种家庭了

悲哀的是,国家经济和消费要全靠这种家庭了

慧翔百科
2026-02-12 11:19:42
郭老终于可以睡个好觉了,央视通报:徐湖平违规拍卖只是冰山一角

郭老终于可以睡个好觉了,央视通报:徐湖平违规拍卖只是冰山一角

瓜哥的动物日记
2026-02-11 12:40:14
知名相声演员卢鑫被张玉浩悬赏1万元?法院:属实;执行局公开信息:暂无可供执行财产

知名相声演员卢鑫被张玉浩悬赏1万元?法院:属实;执行局公开信息:暂无可供执行财产

大风新闻
2026-02-11 17:40:04
新版《斯巴达克斯》低开高走,太黄暴了

新版《斯巴达克斯》低开高走,太黄暴了

来看美剧
2026-02-10 19:34:03
“不漂亮,还很吓人!”艺考生大眼睛赛过小燕子,却引起网友不适

“不漂亮,还很吓人!”艺考生大眼睛赛过小燕子,却引起网友不适

妍妍教育日记
2026-02-03 13:49:25
1949年他还是师长,6年后,他却和老领导并驾齐驱同时被授予中将

1949年他还是师长,6年后,他却和老领导并驾齐驱同时被授予中将

浔阳咸鱼
2026-02-12 10:20:10
整容成瘾、抛妻娶粉?“消失”的宋小宝,终究为曾经的荒唐买了单

整容成瘾、抛妻娶粉?“消失”的宋小宝,终究为曾经的荒唐买了单

启迪你的思维
2026-02-02 20:56:29
郭德纲一家四口现身,王惠染绿发体重超200斤,郭汾阳给麒麟抢花

郭德纲一家四口现身,王惠染绿发体重超200斤,郭汾阳给麒麟抢花

疯说时尚
2026-02-12 09:41:11
安徽女孩远嫁美国生3娃,8年后崩溃闹离婚,如今近况令人唏嘘!

安徽女孩远嫁美国生3娃,8年后崩溃闹离婚,如今近况令人唏嘘!

二大爷观世界
2026-02-06 18:15:48
油价一夜大变!2月11日全国加油站调价后的92、95号汽油价格最新公布

油价一夜大变!2月11日全国加油站调价后的92、95号汽油价格最新公布

沙雕小琳琳
2026-02-11 09:57:12
冬奥会第6日金牌榜,挪威断层领跑,瑞士第2美国第3,中国排第14

冬奥会第6日金牌榜,挪威断层领跑,瑞士第2美国第3,中国排第14

球盲百小易
2026-02-12 01:57:03
“书记,你一件冲锋衣顶农民一年收成!”女选调生下乡,却被威胁

“书记,你一件冲锋衣顶农民一年收成!”女选调生下乡,却被威胁

妍妍教育日记
2026-02-04 18:29:23
第8艘!美军空降印度洋,抢15万吨中国香港油轮,针对中俄古委伊

第8艘!美军空降印度洋,抢15万吨中国香港油轮,针对中俄古委伊

谛听骨语本尊
2026-02-10 12:39:22
2026-02-12 12:15:00
智东西 incentive-icons
智东西
聚焦智能变革,服务产业升级。
11222文章数 116968关注度
往期回顾 全部

科技要闻

传苹果新Siri再遇挫 多项AI功能或推迟发布

头条要闻

立陶宛总理:考虑将"台湾代表处"更名为"台北代表处"

头条要闻

立陶宛总理:考虑将"台湾代表处"更名为"台北代表处"

体育要闻

31岁首次参加冬奥,10年前她是个水管工

娱乐要闻

体操运动员坠楼涉事教练被立案调查

财经要闻

中国乳业2025年回顾:行业寒潮压顶

汽车要闻

具身机器人,能否助力理想打赢全新L9这一仗?

态度原创

本地
家居
艺术
房产
公开课

本地新闻

下一站是嘉禾望岗,请各位乘客做好哭泣准备

家居要闻

本真栖居 爱暖伴流年

艺术要闻

这幅草书14个字,您能认全吗?颜柳欧赵品析,唯钟欧体气节

房产要闻

999元开线上免税店?海南爆出免税大骗局,多人已被抓!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版