网易首页 > 网易号 > 正文 申请入驻

实时视频版「Nano Banana」来了!160亿参数重磅开源

0
分享至


新智元报道


这个 8 月,AI 视频赛道的军备竞赛又升级了。

字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗舰的三分之一。

整个赛道争的还是同一个指标:谁能一口气生成得更长、更连贯、更便宜。

但这场比赛有一个所有人都默认的前提:你得先等视频生成完,看一下,才知道自己想不想改。如果想改,对不起,重新排队。

有意思的是,隔壁语音赛道已经把这个前提拆掉了。就在几周前,OpenAI 发布 GPT-Live,语音交互从「说一句等一句」的回合制进化成全双工——AI 能边听边说,不用等你把话讲完。


语音对话率先证明了一件事:「实时」本身就是一种新范式。

8 月 5 日,京东把同样的事情搬到了视频编辑上。

京东开源的 JoyAI-Video-Edit,是这个赛道里第一个同时做到「流式架构 + 实时速度 + 可用质量」的模型。

部署代码、技术报告、在线 Demo 和模型权重同天在 Hugging Face 和 GitHub 上放出。


开源地址:

GitHub:https://github.com/jd-opensource/JoyAI-Video-Edit

Hugging Face:https://huggingface.co/jdopensource/JoyAI-Video-Edit

实时视频版的Nano Banana

先说一下JoyAI-Video-Edit的效果——

720P 分辨率下模型推理速度达到每秒 30 帧,系统端到端稳定在 24FPS,而且支持任意时长的稳定流式编辑。视频可以一直播、一直改,没有时间上限。

换句话说,对着视频你可以不断动动嘴实现各种视觉特效。

变老、变年轻、变成乐高小人,甚至是拉布拉多,一句话的事,就能实时渲染出来。

太好玩了。

下面这视频,你能想象是实时测试出来的效果吗?


比如说,直播间里,家装视频播到卧室,枕头、床单、画和灯光当场换一遍,室内装修直接上一个档次。


这事可不简单。

Seedance 2.5、MiniMax H3这些是视频生成模型:从文字或图片出发,造一段视频。

Runway Aleph、VACE做的是视频编辑:拿到一段已有视频,按指令改人物、换背景、调风格。

但不管生成还是编辑,这些模型都有一个共同特点——它们是离线的。把整段视频吃进去、整段处理完、整段吐出来。

流式视频编辑是第三件事。它可以实时处理任何一条「活的」视频流上:直播、视频通话、摄像头画面、游戏画面。

JoyAI-Video-Edit不仅是「流式」视频编辑模型,还能实现「实时」视频编辑。

简单说,「流式」决定了模型能不能挂到一条活的视频流上边来边改,「实时」决定了改的速度跟不跟得上播放。两个都得有,缺一个都不行。但在 JoyAI-Video-Edit 之前,这个赛道没有一个够到 24 帧,也就是视频流畅播放的最低门槛。


要「边播边改」,先过两道硬坎

让视频在播放中实时编辑,听起来很炫酷,但技术上得跨过两道门槛。

第一道门槛是速度。视频这东西,本质就是一帧帧画面按固定节奏刷过去,一般是每秒 24 到 30 帧。模型处理得比播放慢,画面就卡。

JoyAI-Video-Edit 的做法是,画面来一帧就改一帧,改完立刻往外送,不用等后面的画面到齐,也不用提前知道这段视频到底有多长。打个比方,这就像同声传译——听一句翻一句,不用等演讲者把整段讲完。

它的底层架构是一个 MLLM 条件编码器、一个因果视频 VAE,再加上一个 16B 参数的多模态扩散 Transformer,整套系统按自回归扩散编辑器来训练和部署。


160 亿参数的模型,按正常流程跑一帧要反复迭代很多步,离实时差得远。

团队的做法是把这个过程「蒸馏」掉,用一种叫 SA-DMD 的训练方法,让模型从原来的十几步迭代压缩到只走两步就能出图。相当于一个老教授本来每道题都要在草稿纸上演算半天,现在被训练成了看一眼就能报答案的老手。


在单张 Nvidia B200 GPU 上,VAE 编码 22 毫秒、DiT 去噪 185 毫秒、VAE 解码 19 毫秒,整个流程的请求到响应延迟只有 226 毫秒,端到端吞吐量达到 30.1 FPS。

这里有一个值得注意的细节:之前所有流式编辑器都为了跑得快,把模型做小。StreamDiffusionV2 和 LiveEdit 都是 1.3B 参数,SANA-Streaming 是 2B,分辨率也压到 480P。结果是快而废,画面质量拉不上来。

JoyAI-Video-Edit 使用16B 参数,720P 分辨率速度快 1.4 到 2 倍。

第二道门槛是时长。此前的流式编辑模型基本只能处理几秒钟到一两分钟的片段,越往后画面越容易「漂」。

颜色变了、物体变形了、风格跑偏了。根本原因在于,自回归模型在推理时不断消费自己之前的输出,一点误差经过多轮累积,最后就变成了肉眼可见的崩坏。

而且流式编辑比流式生成更难。流式生成只需要跟自己的历史保持一致,没有标准答案,画歪了也叫创作。流式编辑要同时满足三个互相打架的约束:前面改过的画面不能跟后面打架,改完的结果不能跟原视频长得面目全非,而且同一条编辑指令从头到尾得改得一样。

JoyAI-Video-Edit 技术报告给出的解法叫「有界 KV 状态推理」。说白了就是限制模型的记忆量:让它只记住最近处理过的几段画面,再加上视频开头的第一帧当参照,其他的全部扔掉。这样不管视频播了一分钟还是一小时,模型的计算量和内存占用始终是固定的,不会越跑越慢。

但光限制记忆还不够——记得少就容易忘,忘了就容易画飘。团队在训练阶段专门针对这个问题做了优化:让模型反复练习在「只记一点点」的条件下编辑长视频,直到它学会在有限记忆里也能把画面稳住。

结果就是:视频可以一直播下去,编辑效果始终稳定。

流式赛道断层领先,追平离线主流

喊「领先」容易,但终究要拿数据说话。研究团队做了两轮对比测试。

短视频评测(OpenVE-Bench):在这个业界权威的通用视频编辑基准测试中,JoyAI-Video-Edit 的总分达到 3.60,对比流式编辑模型 SANA-Streaming(2.62)、LiveEdit(2.00)、XMax-X2.0(1.87)和 StreamDiffusionV2(1.23),在五个子任务中有四个拿下流式模型第一。


全局风格转换、局部替换、局部删除这几类任务上优势尤其突出,其中局部删除的 4.06 分甚至超过了所有离线模型。

把这组分数放到整个赛道里看会更清楚。此前流式编辑模型的分数区间是 1.23 到 2.62(满分 5),这个区间的含义不是「稍差」,是基本不可用。对比之下,商业闭源的 Runway Aleph 是 3.45,PixVerse V6 是 3.05。

JoyAI-Video-Edit 的 3.60 已经站进了离线商业模型的区间。一个实时跑的模型,画面质量追上了那些慢慢离线处理的前辈。

长视频评测(LongV2VBench):团队还专门构建了一个视频编辑任务的基准测试,覆盖背景更换、全局风格、局部添加、局部修改和局部删除五大类场景。

JoyAI-Video-Edit 在全部五个类别上都排第一,总分 3.30,比最强对手 XMax-X2.0 高出 1.59 分。同时速度也最快:30.19 FPS,比 XMax-X2.0 快了 44.4%,是 SANA-Streaming 的两倍多。


人类评估的结果更直接:在与四个流式编辑模型的两两盲评中,JoyAI-Video-Edit 的偏好率分别是 90%、87%、87% 和 81%。面对强离线模型 Bernini-R,打了个 48% 对 44% 的微弱优势。


准确的判断是:JoyAI-Video-Edit 在流式编辑赛道断层第一,在全赛道追平了主流离线水平,但还没打赢最强的几个离线商业模型。它证明了流式编辑和离线编辑之间的质量鸿沟,可以被填平。

真正改变的是干活的方式

流式实时编辑这个能力,到底能让干活的方式发生什么变化?

第一层变化:「等渲染」这件事消失了。

不管是做特效、搞三维还是用 AI 生成视频,干活的人最熟悉的循环就是:调一下参数,等,看一眼结果,不满意,再等。创作的手感就死在这个「等」字上。

JoyAI-Video-Edit 的响应延迟只有 226 毫秒,快到你感觉不到延迟。拧一下色调视频立刻变,拧一下风格立刻换,不满意立刻拧回来,把后期变成了现场。

现在,可以边直播边创作。这和元宇宙、VR、AR可能还有区别,但视频编辑的星星之火,未尝不可燎虚拟现实之原。

第二层变化:从「一次拍摄 = 一个成品」,变成「一次拍摄 = 无数个成品」。

这条最能解释京东为什么要干这件事。今天你想要五种配色的服装视频,就得渲五版、存五份文件。如果编辑是实时的、流式进行的,那么变体可以按需生成——同一条直播流,系统可以给不同的人呈现不同的搭配、不同的背景。

通过参考图引导编辑(RV2V),上传一张衣服图片就能把视频里的人物实时换装,动作、姿态全部保留。这个能力放到电商直播里,意味着观众看到的每件衣服,都可以是为他实时生成的版本。

第三层变化:摄像头和屏幕之间,第一次多了一个可编程的语义层。

既然视频播多久它就能改多久,那它就能挂到任何一条正在播的视频流上——直播、视频通话、摄像头画面都行。

这跟美颜滤镜可不是一回事:滤镜不看画面里有什么,只是逐帧套一层效果,前一帧和后一帧之间也没有关联。流式编辑是看懂了画面内容再改,而且前后帧改得连贯一致。

导演、设计师或客户不需要等待多个完整版本,而是可以在同一段运动画面上不断调整对象、颜色和风格,观察这些变化在不同角度、光照和动作下是否成立。

它降低的不只是渲染时间,还有团队形成共识的成本。

换句话说,模型的价值不只在于更快生产最终内容,还在于帮助人们更快排除错误方案。

这类能力很可能先进入预演、评审和远程协作环节,因为这些环节对实时反馈的需求,往往比对最终画质的要求更高。

沿着这个方向往外走,实时虚拟试衣、真人主播流的风格化改造、游戏和虚拟制片的实时后处理,都是它能接的活。

更远的一步:从直播间到机械臂

如果只是做内容创作,JoyAI-Video-Edit 已经很好用了。但京东想把这件事往更深处推。

具身智能行业现在有一个公认的瓶颈:机器人训练需要海量的抓取、搬运和操作视频,但高质量物理交互数据极度稀缺。

行业里现在要把一段人手操作的视频变成机器人训练数据,得串好几个模型。一个模型把画面里的人手抠掉,一个模型把抠掉的地方补上背景,再来一个模型把机械臂渲染贴回去。全串起来一放量,到处卡。

JoyAI-Video-Edit 把这条流水线压成了一句话。物体位置、空间关系和动作轨迹全部保留,只换机器人形态,30 FPS 实时跑完。


这不是京东拍脑袋想的方向,而是跟它这两年在布局的另一盘棋直接相关。

京东手上的 JoyAI 模型矩阵,现在已经凑齐了一套班子:JoyAI-VL-Interaction 让机器持续「看」并做出实时反应;JoyAI-Talker 让机器能「说」也能「听」;JoyAI-RA 让机器人学会抓取和操控;JoyAI-Video-Edit 则负责批量造训练这些机器人所需要的视频数据。

看得懂、听得懂、说得出、抓得住、还能自己造训练素材。

这些能力拼在一起,干的就是京东每天的活:管仓库、跑物流、送快递、开直播。京东说要建「全球最大的物理世界运营中心」,不是喊口号。

它的生意本身就长在物理世界里,这套模型矩阵就是给自家业务攒的基建。

编辑:大卫 所罗门

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
余承东:尊界V800、V680新车24小时大定突破3500台

余承东:尊界V800、V680新车24小时大定突破3500台

齐鲁壹点
2026-08-07 10:56:59
美媒称五角大楼想用战术核武器对抗中俄,专家:赤裸裸的“核讹诈”

美媒称五角大楼想用战术核武器对抗中俄,专家:赤裸裸的“核讹诈”

环球网资讯
2026-08-07 07:20:30
婚外胚胎事件:唐某父母后悔晚已:记恨儿媳毁了儿子

婚外胚胎事件:唐某父母后悔晚已:记恨儿媳毁了儿子

一口娱乐
2026-08-07 10:54:27
最新进展:女儿梯下曾捞起遗体,失联女孩最后信号为何指向居民区

最新进展:女儿梯下曾捞起遗体,失联女孩最后信号为何指向居民区

社会日日鲜
2026-08-07 07:06:21
知名物理学家博士学位被撤销,曾用香肠冒充恒星照片

知名物理学家博士学位被撤销,曾用香肠冒充恒星照片

化学人生
2026-08-05 22:45:53
梁文锋这次玩大了!彭博社爆料:DeepSeek刚融到几百亿,转头就跑内蒙建基地了!

梁文锋这次玩大了!彭博社爆料:DeepSeek刚融到几百亿,转头就跑内蒙建基地了!

青青子衿
2026-08-07 11:44:34
队报:非洲足联全票支持国际足联主席因凡蒂诺

队报:非洲足联全票支持国际足联主席因凡蒂诺

懂球帝
2026-08-07 05:13:08
去年黄岩岛围堵菲律宾的行动,牺牲了两名海警战士

去年黄岩岛围堵菲律宾的行动,牺牲了两名海警战士

军武吐槽君
2026-08-06 18:57:42
丈夫出轨后,妻子被情妇活埋,2019年情妇:我有3个情夫只爱他1个

丈夫出轨后,妻子被情妇活埋,2019年情妇:我有3个情夫只爱他1个

汉史趣闻
2026-08-07 09:26:04
做辅警时一次扫黄行动,我偷放了一富婆,7天后领导带着富婆找我

做辅警时一次扫黄行动,我偷放了一富婆,7天后领导带着富婆找我

麦子情感故事
2026-08-07 11:34:10
拿不出考勤和社保流水,货就别想进欧洲!中国制造遭遇最严“合规狙击”

拿不出考勤和社保流水,货就别想进欧洲!中国制造遭遇最严“合规狙击”

公子麦少
2026-08-06 16:37:23
防空导弹严重短缺,泽连斯基公开喊话,乌克兰失去导弹拦截能力?

防空导弹严重短缺,泽连斯基公开喊话,乌克兰失去导弹拦截能力?

环球网资讯
2026-08-07 06:48:17
于和伟给8个哥姐全款各买一套房,被三哥指着鼻子骂,从不解释的他,这次红着眼回了一句话...

于和伟给8个哥姐全款各买一套房,被三哥指着鼻子骂,从不解释的他,这次红着眼回了一句话...

背包旅行
2026-08-06 18:04:54
陈冲自曝19岁被侵犯,隐忍43年书中揭露真相

陈冲自曝19岁被侵犯,隐忍43年书中揭露真相

绚丽的画卷
2026-08-07 04:40:32
罕见失态!泰国外长公开训斥中国大使,这场外交风波到底谁的问题

罕见失态!泰国外长公开训斥中国大使,这场外交风波到底谁的问题

观星赏月
2026-08-07 00:57:04
德国高温致死1.19万人 为2016年来最高纪录

德国高温致死1.19万人 为2016年来最高纪录

新京报
2026-08-07 07:42:22
男性延至68岁,女性延至63岁!多地发文

男性延至68岁,女性延至63岁!多地发文

阜阳发布
2026-08-04 16:22:21
那个演三德子的赵亮,砸2000万养鸡血本无归,抑郁 7 年现状如何

那个演三德子的赵亮,砸2000万养鸡血本无归,抑郁 7 年现状如何

历史的烟火
2026-08-07 12:30:58
知名女演员车祸去世,热搜炸了!

知名女演员车祸去世,热搜炸了!

黎兜兜
2026-08-07 08:15:55
伦敦富人区怒了:3英里内15座清真寺,还要建13层“超级清真寺”俯视基督教小教堂

伦敦富人区怒了:3英里内15座清真寺,还要建13层“超级清真寺”俯视基督教小教堂

全球吃瓜现场
2026-08-06 17:30:24
2026-08-07 14:59:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15883文章数 66996关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

1岁宝宝碰坏房间纸巾盒宝妈被要求赔付924元 酒店回应

头条要闻

1岁宝宝碰坏房间纸巾盒宝妈被要求赔付924元 酒店回应

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

以为能“毁掉”周杰伦,自己却被曝光

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

10万级大满配 双C位的东风风神L8Y可以无脑冲

态度原创

教育
数码
家居
艺术
公开课

教育要闻

In the Blink of an Eye真不是眨眼那么简单!莎士比亚和《圣经》联手打造的瞬间天花板

数码要闻

芯片屏幕全都没问题!iPhone18 Pro量产卡壳根源曝光:内存短缺

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

阿列克谢・哈拉莫夫|俄罗斯古典肖像大师

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版