网易首页 > 网易号 > 正文 申请入驻

实时视频版「Nano Banana」来了!160亿参数重磅开源

0
分享至


新智元报道


这个 8 月,AI 视频赛道的军备竞赛又升级了。

字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗舰的三分之一。

整个赛道争的还是同一个指标:谁能一口气生成得更长、更连贯、更便宜。

但这场比赛有一个所有人都默认的前提:你得先等视频生成完,看一下,才知道自己想不想改。如果想改,对不起,重新排队。

有意思的是,隔壁语音赛道已经把这个前提拆掉了。就在几周前,OpenAI 发布 GPT-Live,语音交互从「说一句等一句」的回合制进化成全双工——AI 能边听边说,不用等你把话讲完。


语音对话率先证明了一件事:「实时」本身就是一种新范式。

8 月 5 日,京东把同样的事情搬到了视频编辑上。

京东开源的 JoyAI-Video-Edit,是这个赛道里第一个同时做到「流式架构 + 实时速度 + 可用质量」的模型。

部署代码、技术报告、在线 Demo 和模型权重同天在 Hugging Face 和 GitHub 上放出。


开源地址:

GitHub:https://github.com/jd-opensource/JoyAI-Video-Edit

Hugging Face:https://huggingface.co/jdopensource/JoyAI-Video-Edit

实时视频版的Nano Banana

先说一下JoyAI-Video-Edit的效果——

720P 分辨率下模型推理速度达到每秒 30 帧,系统端到端稳定在 24FPS,而且支持任意时长的稳定流式编辑。视频可以一直播、一直改,没有时间上限。

换句话说,对着视频你可以不断动动嘴实现各种视觉特效。

变老、变年轻、变成乐高小人,甚至是拉布拉多,一句话的事,就能实时渲染出来。

太好玩了。

下面这视频,你能想象是实时测试出来的效果吗?


比如说,直播间里,家装视频播到卧室,枕头、床单、画和灯光当场换一遍,室内装修直接上一个档次。


这事可不简单。

Seedance 2.5、MiniMax H3这些是视频生成模型:从文字或图片出发,造一段视频。

Runway Aleph、VACE做的是视频编辑:拿到一段已有视频,按指令改人物、换背景、调风格。

但不管生成还是编辑,这些模型都有一个共同特点——它们是离线的。把整段视频吃进去、整段处理完、整段吐出来。

流式视频编辑是第三件事。它可以实时处理任何一条「活的」视频流上:直播、视频通话、摄像头画面、游戏画面。

JoyAI-Video-Edit不仅是「流式」视频编辑模型,还能实现「实时」视频编辑。

简单说,「流式」决定了模型能不能挂到一条活的视频流上边来边改,「实时」决定了改的速度跟不跟得上播放。两个都得有,缺一个都不行。但在 JoyAI-Video-Edit 之前,这个赛道没有一个够到 24 帧,也就是视频流畅播放的最低门槛。


要「边播边改」,先过两道硬坎

让视频在播放中实时编辑,听起来很炫酷,但技术上得跨过两道门槛。

第一道门槛是速度。视频这东西,本质就是一帧帧画面按固定节奏刷过去,一般是每秒 24 到 30 帧。模型处理得比播放慢,画面就卡。

JoyAI-Video-Edit 的做法是,画面来一帧就改一帧,改完立刻往外送,不用等后面的画面到齐,也不用提前知道这段视频到底有多长。打个比方,这就像同声传译——听一句翻一句,不用等演讲者把整段讲完。

它的底层架构是一个 MLLM 条件编码器、一个因果视频 VAE,再加上一个 16B 参数的多模态扩散 Transformer,整套系统按自回归扩散编辑器来训练和部署。


160 亿参数的模型,按正常流程跑一帧要反复迭代很多步,离实时差得远。

团队的做法是把这个过程「蒸馏」掉,用一种叫 SA-DMD 的训练方法,让模型从原来的十几步迭代压缩到只走两步就能出图。相当于一个老教授本来每道题都要在草稿纸上演算半天,现在被训练成了看一眼就能报答案的老手。


在单张 Nvidia B200 GPU 上,VAE 编码 22 毫秒、DiT 去噪 185 毫秒、VAE 解码 19 毫秒,整个流程的请求到响应延迟只有 226 毫秒,端到端吞吐量达到 30.1 FPS。

这里有一个值得注意的细节:之前所有流式编辑器都为了跑得快,把模型做小。StreamDiffusionV2 和 LiveEdit 都是 1.3B 参数,SANA-Streaming 是 2B,分辨率也压到 480P。结果是快而废,画面质量拉不上来。

JoyAI-Video-Edit 使用16B 参数,720P 分辨率速度快 1.4 到 2 倍。

第二道门槛是时长。此前的流式编辑模型基本只能处理几秒钟到一两分钟的片段,越往后画面越容易「漂」。

颜色变了、物体变形了、风格跑偏了。根本原因在于,自回归模型在推理时不断消费自己之前的输出,一点误差经过多轮累积,最后就变成了肉眼可见的崩坏。

而且流式编辑比流式生成更难。流式生成只需要跟自己的历史保持一致,没有标准答案,画歪了也叫创作。流式编辑要同时满足三个互相打架的约束:前面改过的画面不能跟后面打架,改完的结果不能跟原视频长得面目全非,而且同一条编辑指令从头到尾得改得一样。

JoyAI-Video-Edit 技术报告给出的解法叫「有界 KV 状态推理」。说白了就是限制模型的记忆量:让它只记住最近处理过的几段画面,再加上视频开头的第一帧当参照,其他的全部扔掉。这样不管视频播了一分钟还是一小时,模型的计算量和内存占用始终是固定的,不会越跑越慢。

但光限制记忆还不够——记得少就容易忘,忘了就容易画飘。团队在训练阶段专门针对这个问题做了优化:让模型反复练习在「只记一点点」的条件下编辑长视频,直到它学会在有限记忆里也能把画面稳住。

结果就是:视频可以一直播下去,编辑效果始终稳定。

流式赛道断层领先,追平离线主流

喊「领先」容易,但终究要拿数据说话。研究团队做了两轮对比测试。

短视频评测(OpenVE-Bench):在这个业界权威的通用视频编辑基准测试中,JoyAI-Video-Edit 的总分达到 3.60,对比流式编辑模型 SANA-Streaming(2.62)、LiveEdit(2.00)、XMax-X2.0(1.87)和 StreamDiffusionV2(1.23),在五个子任务中有四个拿下流式模型第一。


全局风格转换、局部替换、局部删除这几类任务上优势尤其突出,其中局部删除的 4.06 分甚至超过了所有离线模型。

把这组分数放到整个赛道里看会更清楚。此前流式编辑模型的分数区间是 1.23 到 2.62(满分 5),这个区间的含义不是「稍差」,是基本不可用。对比之下,商业闭源的 Runway Aleph 是 3.45,PixVerse V6 是 3.05。

JoyAI-Video-Edit 的 3.60 已经站进了离线商业模型的区间。一个实时跑的模型,画面质量追上了那些慢慢离线处理的前辈。

长视频评测(LongV2VBench):团队还专门构建了一个视频编辑任务的基准测试,覆盖背景更换、全局风格、局部添加、局部修改和局部删除五大类场景。

JoyAI-Video-Edit 在全部五个类别上都排第一,总分 3.30,比最强对手 XMax-X2.0 高出 1.59 分。同时速度也最快:30.19 FPS,比 XMax-X2.0 快了 44.4%,是 SANA-Streaming 的两倍多。


人类评估的结果更直接:在与四个流式编辑模型的两两盲评中,JoyAI-Video-Edit 的偏好率分别是 90%、87%、87% 和 81%。面对强离线模型 Bernini-R,打了个 48% 对 44% 的微弱优势。


准确的判断是:JoyAI-Video-Edit 在流式编辑赛道断层第一,在全赛道追平了主流离线水平,但还没打赢最强的几个离线商业模型。它证明了流式编辑和离线编辑之间的质量鸿沟,可以被填平。

真正改变的是干活的方式

流式实时编辑这个能力,到底能让干活的方式发生什么变化?

第一层变化:「等渲染」这件事消失了。

不管是做特效、搞三维还是用 AI 生成视频,干活的人最熟悉的循环就是:调一下参数,等,看一眼结果,不满意,再等。创作的手感就死在这个「等」字上。

JoyAI-Video-Edit 的响应延迟只有 226 毫秒,快到你感觉不到延迟。拧一下色调视频立刻变,拧一下风格立刻换,不满意立刻拧回来,把后期变成了现场。

现在,可以边直播边创作。这和元宇宙、VR、AR可能还有区别,但视频编辑的星星之火,未尝不可燎虚拟现实之原。

第二层变化:从「一次拍摄 = 一个成品」,变成「一次拍摄 = 无数个成品」。

这条最能解释京东为什么要干这件事。今天你想要五种配色的服装视频,就得渲五版、存五份文件。如果编辑是实时的、流式进行的,那么变体可以按需生成——同一条直播流,系统可以给不同的人呈现不同的搭配、不同的背景。

通过参考图引导编辑(RV2V),上传一张衣服图片就能把视频里的人物实时换装,动作、姿态全部保留。这个能力放到电商直播里,意味着观众看到的每件衣服,都可以是为他实时生成的版本。

第三层变化:摄像头和屏幕之间,第一次多了一个可编程的语义层。

既然视频播多久它就能改多久,那它就能挂到任何一条正在播的视频流上——直播、视频通话、摄像头画面都行。

这跟美颜滤镜可不是一回事:滤镜不看画面里有什么,只是逐帧套一层效果,前一帧和后一帧之间也没有关联。流式编辑是看懂了画面内容再改,而且前后帧改得连贯一致。

导演、设计师或客户不需要等待多个完整版本,而是可以在同一段运动画面上不断调整对象、颜色和风格,观察这些变化在不同角度、光照和动作下是否成立。

它降低的不只是渲染时间,还有团队形成共识的成本。

换句话说,模型的价值不只在于更快生产最终内容,还在于帮助人们更快排除错误方案。

这类能力很可能先进入预演、评审和远程协作环节,因为这些环节对实时反馈的需求,往往比对最终画质的要求更高。

沿着这个方向往外走,实时虚拟试衣、真人主播流的风格化改造、游戏和虚拟制片的实时后处理,都是它能接的活。

更远的一步:从直播间到机械臂

如果只是做内容创作,JoyAI-Video-Edit 已经很好用了。但京东想把这件事往更深处推。

具身智能行业现在有一个公认的瓶颈:机器人训练需要海量的抓取、搬运和操作视频,但高质量物理交互数据极度稀缺。

行业里现在要把一段人手操作的视频变成机器人训练数据,得串好几个模型。一个模型把画面里的人手抠掉,一个模型把抠掉的地方补上背景,再来一个模型把机械臂渲染贴回去。全串起来一放量,到处卡。

JoyAI-Video-Edit 把这条流水线压成了一句话。物体位置、空间关系和动作轨迹全部保留,只换机器人形态,30 FPS 实时跑完。


这不是京东拍脑袋想的方向,而是跟它这两年在布局的另一盘棋直接相关。

京东手上的 JoyAI 模型矩阵,现在已经凑齐了一套班子:JoyAI-VL-Interaction 让机器持续「看」并做出实时反应;JoyAI-Talker 让机器能「说」也能「听」;JoyAI-RA 让机器人学会抓取和操控;JoyAI-Video-Edit 则负责批量造训练这些机器人所需要的视频数据。

看得懂、听得懂、说得出、抓得住、还能自己造训练素材。

这些能力拼在一起,干的就是京东每天的活:管仓库、跑物流、送快递、开直播。京东说要建「全球最大的物理世界运营中心」,不是喊口号。

它的生意本身就长在物理世界里,这套模型矩阵就是给自家业务攒的基建。

编辑:大卫 所罗门

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

二疯说球
2026-07-31 10:14:55
贡萨洛-拉莫斯:我助葡萄牙晋级世界杯16强,打西班牙却没上场

贡萨洛-拉莫斯:我助葡萄牙晋级世界杯16强,打西班牙却没上场

懂球帝
2026-09-30 22:15:07
黑龙江富豪惨遭灭门,保姆装死逃过一劫,保姆:凶手怎么会是他?

黑龙江富豪惨遭灭门,保姆装死逃过一劫,保姆:凶手怎么会是他?

林林故事揭秘
2025-04-10 17:37:49
原来有车不仅带给女生安全感,还有爽感!网友:我要有,我也爽!

原来有车不仅带给女生安全感,还有爽感!网友:我要有,我也爽!

另子维爱读史
2026-10-01 19:17:45
吉利版“大揽胜”SUV曝光,5座6座都有!

吉利版“大揽胜”SUV曝光,5座6座都有!

米粒说车唯一呀
2026-10-01 19:36:17
印度机长被刺重伤后反抗,数人齐力把客机从“死亡坠落”中拉回,174人获救

印度机长被刺重伤后反抗,数人齐力把客机从“死亡坠落”中拉回,174人获救

译言
2026-10-01 07:25:50
满心欢喜出境游,72岁阿婆递上护照,边检民警愣住了!证件作废,旅游泡汤

满心欢喜出境游,72岁阿婆递上护照,边检民警愣住了!证件作废,旅游泡汤

新民晚报
2026-09-30 13:27:21
国庆前夕,第一批“大聪明”们又又又被堵在路上了

国庆前夕,第一批“大聪明”们又又又被堵在路上了

News脑洞
2026-09-30 15:44:04
解析2027款丰田皇冠:轿车配方大改,经典皇冠味道还在不在

解析2027款丰田皇冠:轿车配方大改,经典皇冠味道还在不在

趣味萌宠的日常
2026-10-01 18:57:38
比触电更恐怖!80%家庭每天重复4个致命操作,出事根本来不及

比触电更恐怖!80%家庭每天重复4个致命操作,出事根本来不及

小鹿姐姐情感说
2026-09-30 01:58:15
日本人评价抗美援朝:中国如果不发兵,美国根本走不到鸭绿江边

日本人评价抗美援朝:中国如果不发兵,美国根本走不到鸭绿江边

磊子讲史
2026-09-18 17:03:50
赖少其曾为贺子珍打抱不平,陈毅叮嘱他:有些事并非想象中那么简单!

赖少其曾为贺子珍打抱不平,陈毅叮嘱他:有些事并非想象中那么简单!

历史龙元阁
2026-09-30 17:55:16
就在昨天!林诗栋王楚钦确认退出2026WTT,原因并非大家想的那样

就在昨天!林诗栋王楚钦确认退出2026WTT,原因并非大家想的那样

璀璨幻行者
2026-10-01 19:00:25
9天5个涨停板!股民:又一次卖飞了!

9天5个涨停板!股民:又一次卖飞了!

数据挖掘分析
2026-10-01 15:47:47
独居上海,妻子去世,女儿在国外,86岁达式常忙活半辈子孤独吗?

独居上海,妻子去世,女儿在国外,86岁达式常忙活半辈子孤独吗?

娱圈办事处
2026-09-30 22:30:07
员工集体沉默拒绝加班!央国企领导叫不动人,背后四本账太扎心

员工集体沉默拒绝加班!央国企领导叫不动人,背后四本账太扎心

侃故事的阿庆
2026-10-01 01:21:39
11月3日若开拓者选择不与杨瀚森续约,他依然有三条出路

11月3日若开拓者选择不与杨瀚森续约,他依然有三条出路

姜大叔侃球
2026-10-01 13:15:14
空姐下跪后续:知情人还原现场,她连跪3次还要被踹,东航回应了

空姐下跪后续:知情人还原现场,她连跪3次还要被踹,东航回应了

圆梦的小老头
2026-10-01 01:35:45
史上最大升级!iPad mini 8本月发布:首次OLED屏、A20 Pro+12GB内存

史上最大升级!iPad mini 8本月发布:首次OLED屏、A20 Pro+12GB内存

快科技
2026-10-01 07:29:07
热苏斯:我和C罗约好首战后休两场,热身太久没上他生我气了

热苏斯:我和C罗约好首战后休两场,热身太久没上他生我气了

懂球帝
2026-10-01 03:04:06
2026-10-01 20:12:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16324文章数 67099关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

教育
艺术
数码
亲子
公开课

教育要闻

成都中考体考标准偏高,家长呼吁下调:教育局这样回应

艺术要闻

16幅 Alexander Shevelev风景油画

数码要闻

曝三星Galaxy Glasses智能眼镜通过美国FCC认证,有望11月上市

亲子要闻

开学一个月“学习困难门诊”迎就诊高峰,医生:就诊诉求几乎只有“提分”

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版