![]()
你有没有想过这样一个场景:你正在开着一场直播,画面里是你自己在沙漠里踢球,突然你想让整个场景变成雨中的体育场,下一秒想给自己套上钢铁侠的战甲,再过一会儿又想把整个画风换成卡通风格。这一切的转变,不是拍完之后回去后期做的,而是画面正在直播的同时,实时发生的。
这不是科幻电影的桥段。这是京东的Joy未来学院团队在2026年8月发布的一篇论文里,真真切切实现的东西,叫做JoyAI-Video-Edit。它能在一块英伟达B200显卡上,以720p分辨率、每秒30帧的速度,一边接收视频流一边完成编辑,而且不知道视频到底有多长,可能是10秒的短片,也可能是一小时的直播。
这事听起来简单,做起来却是个大麻烦。我们先花点时间搞清楚,这个麻烦到底难在哪里。
视频编辑的两个世界,一直互相看不上
在这篇论文出现之前,视频编辑领域基本活在两个割裂的世界里。
第一个世界是离线编辑。像VACE、OpenVE-Edit这些高质量的视频编辑模型,工作方式是这样的:你把整段视频喂给它,它把整个视频通读一遍(专业说法叫双向注意力,也就是模型可以同时看到过去和未来的所有帧),然后经过反复的去噪迭代,最后一次性吐出编辑好的结果。这种方式效果很好,因为模型能看到全局信息,前后连贯性有保证。但问题也很明显:它必须等你把整段视频都拍完、传完,才能开始工作。直播场景下,这条路直接走不通,你总不能让观众在弹幕里刷"加载中"刷上一分钟。
第二个世界是流式(streaming)编辑,也就是所谓的实时编辑。这几年出现了StreamDiffusionV2、SANA-Streaming、LiveEdit这些方案,试图解决实时性的问题。但论文里给出的评测数据很扎心:这些流式方法在权威评测集OpenVE-Bench上的综合得分普遍在1.2到2.6分(满分5分),而离线的强模型能做到3.6分甚至更高。换句话说,为了追求"实时"这一个指标,这些方法把编辑质量做出了明显的妥协,画面容易模糊、色彩会漂移、编辑指令执行得也不够准。
这就是这篇论文要解决的核心矛盾:**能不能既做到像离线模型一样的编辑质量,又做到像直播一样的实时响应?**
要回答这个问题,得先搞清楚为什么"直接把离线模型改造成实时模型"这条路走不通。
把双向模型硬掰成单向模型,会遇到什么坑
最直观的思路是:既然离线模型效果好,那就想办法让它别看"未来"的帧,只看"过去"的帧,这样不就能实时输出了吗?
这个思路在工程上是可行的,业内管这个过程叫做因果化(causalization)。但论文作者发现,单纯做这个改造,会撞上一个叫做训练-推理不匹配(train-inference mismatch)的问题。
这里需要展开说一下。模型在训练的时候,通常会用"教师强制"(teacher forcing)的方式:也就是说,当模型在预测第10秒的画面时,研究者会把真实、干净的第1到9秒画面喂给它作为历史参考。这样训练出来的模型,见到的历史永远是完美无瑕的。
但真到了实际部署推理的时候,事情就不一样了。模型在生成第10秒画面时,能参考的第1到9秒画面,不是真实数据,而是模型自己之前生成出来的、可能带着瑕疵的画面。如果第3秒的画面颜色稍微偏了一点,这个偏差就会被当作"历史事实"传递给第4秒、第5秒……一路累积下去。
这就好比你在玩一个传话游戏。第一个人说的话是准确的原文,但从第二个人开始,每个人听到的都是上一个人转述之后的版本。如果每次转述都有百分之一的误差,传到第100个人的时候,原意可能已经面目全非了。如果不做任何针对性处理,直接把离线模型改造成流式模型进行长时间生成,画面会逐渐出现颜色漂移、人物身份漂移、背景细节丢失,这就是论文里反复强调的"长期漂移"(long-term drift)问题。
而且视频编辑这件事,比单纯的视频生成还要难一层。它不仅要保证前后帧连贯,还必须时刻和当前这一帧的原始源视频对齐,你要保证没被编辑到的部分(比如人物的动作、背景里没提到要改的东西)原封不动地保留下来,同时又要把编辑指令(比如"把主角换成钢铁侠")稳定地执行下去。这是一个动态的平衡:过度依赖"生成的历史",会导致错误累积;过度依赖"原始源视频",又会导致编辑指令执行得不彻底、风格显得畏首畏尾。
搞清楚了这些坑,我们再来看JoyAI-Video-Edit是怎么一步步填的。
第一步:把整个画面切成"块",让模型学会分段看
JoyAI-Video-Edit的整体架构,由三个部分组成。
> 多模态大语言模型(MLLM):负责理解文字指令和视频画面,把"把猫身上加一件毛衣"这种自然语言指令和视频的第一帧画面结合起来,转换成模型能理解的"条件信息"。
> 因果视频VAE(Variational Autoencoder,变分自编码器):负责把视频压缩成更小的"潜在表示",这样模型不用直接处理海量像素,处理效率大大提升。这个VAE的压缩比是8×24×24,意思是每8帧原始视频压缩成1个潜在帧,空间上长宽各压缩24倍。
> 多模态扩散Transformer(MM-DiT):真正干活的主体,把条件信息和视频潜在表示放在一起处理,逐步生成编辑后的画面。
架构定下来之后,第一个关键改造是把处理方式从"整段视频一起看"变成"分块处理"(chunk-wise)。具体做法是:把视频沿着时间轴切成一个个小块(论文里每块对应一个潜在帧,相当于8个原始视频帧),在每个小块内部,模型仍然可以双向地看信息(块内双向注意力),但跨块之间,模型只能看之前的块,不能看未来的块(跨块因果注意力)。
这个设计有个很聪明的地方:为了让计算量不随着视频变长而无限增长,模型只保留一个滑动窗口内的最近几个历史块,再加上第一个块作为"全局锚点"(global sink),不管视频直播了多久,模型每次要处理的历史信息量始终是固定的。
这一点非常关键,我们打个比方。你负责给一场持续几个小时的马拉松直播做同声传译,如果要求你记住从开场到现在说过的每一句话,随着比赛进行你的大脑负担会越来越重,到后期根本忙不过来。但如果你只需要记住最近几分钟发生的事,加上开场时主持人定下的基调(比如"这是一场公益赛事"),那么不管比赛进行多久,你脑子里要处理的信息量始终差不多。这个"开场基调"就相当于论文里的"全局锚点",它锁定了最初的画面风格和内容基准,避免了长时间编辑之后模型"忘了自己在编辑什么"。如果没有这个滑动窗口设计,模型要么会随着视频变长而越跑越慢(因为历史信息一直在累积),要么不得不砍掉历史信息导致长期一致性完全丧失。
分块处理确定之后,还有个训练细节的调整。团队一开始用前面提到的"教师强制"方式训练(用干净的真实历史喂给模型),但很快切换到了一种叫做重采样强制(Resampling Forcing)的方法。做法是,把每个历史块先用模型自己跑一遍单步去噪,生成一个"模型自产"的历史版本(并且这个版本不参与梯度回传,也就是"detached"),再拿这个带瑕疵的历史去训练模型。这样一来,模型在训练阶段就已经习惯了"跟自己生成的、不那么完美的历史打交道",而不是在部署上线之后才第一次遇到这种情况,提前适应,减少现实落差。
第二步:怎么在两步之内做完扩散生成,还不丢画质
光解决了因果化的问题还不够。扩散模型(diffusion model)的核心工作原理,是通过很多步的迭代去噪,一步一步把随机噪声变成清晰画面。步骤越多,画质通常越好,但计算量也越大,实时性就无从谈起。
> 扩散模型:一种生成模型,工作原理是先把清晰的图像逐渐加噪声直到变成完全的随机噪声,然后训练一个模型学会"反向"这个过程,从纯噪声出发,一步步去掉噪声,最终还原/生成出清晰的画面。生成质量通常和去噪步数正相关,步数越多质量越高,但速度越慢。
要做到实时,就得把原本可能需要几十步的去噪过程,压缩到极少的步数。这篇论文用到的技术叫分布匹配蒸馏(Distribution Matching Distillation,简称DMD),这是一种"师生蒸馏"方法:训练一个更小、更快的"学生"模型(生成器),去学习一个效果很好但速度很慢的"教师"模型(真实分数模型)的行为,让学生模型能用远少于教师的步数达到接近的效果。
但直接套用标准DMD在视频编辑上会出问题。原因还是前面提到的那个"历史累积误差",在长时间的自回归推理(也就是模型不断依赖自己之前生成的内容继续往下生成)过程中,生成器会越来越依赖自己不完美的历史,导致编辑内容逐渐偏离原始视频,甚至出现"幻觉"(凭空生成一些不该出现的内容)。
于是团队提出了一个改进版,叫做源锚定分布匹配蒸馏(Source-Anchored Distribution Matching Distillation,简称SA-DMD)。核心思路是,在蒸馏训练阶段,让教师模型(真实分数模型)额外参考和当前编辑块在时间上严格对齐的原始源视频画面,通过一种叫做无分类器引导(Classifier-Free Guidance, CFG)的技术,把"文本指令的引导强度"和"源视频保真度的引导强度"拆成两个独立的调节旋钮,分别控制。这样一来,教师模型给学生的"标准答案",会天然带着"别忘了源视频长什么样"这层约束,学生模型在学习过程中就把这种保真意识吸收进了自己的参数里。
这里有意思的地方在于,这个"源锚定"的操作只作用于训练阶段的教师目标上,实际部署上线之后,模型走的是单一的推理分支,不需要额外去参考源视频进行第二次计算,相当于把"保真度约束"这门功课提前在考前补习班里学扎实了,考试的时候(也就是真实部署时)不需要再翻书对照,直接凭记忆答题就够了。
打个比方,这就像临摹一幅画。如果你只盯着自己刚画完的上一笔往下画(也就是只依赖生成历史),画着画着很容易越画越歪,第一笔偏了一毫米,第二笔基于第一笔又偏了一毫米,十笔下来整幅画可能已经和原图差之千里。但如果你时不时抬头看一眼原画(源视频),把自己刚画的和原画做个对照校准,就能把偏差及时纠正回来。SA-DMD做的就是这件事:让"训练过程中的老师"时刻拿着原画去纠偏,教出来的"学生"(也就是最终部署的模型)自然而然地就带上了这种不容易跑偏的习惯,而且不需要在实际画画的时候真的再拿一张原画出来对照,因为这个习惯已经刻进肌肉记忆里了。
经过SA-DMD压缩之后,论文里提到扩散去噪的步骤最终被压缩到只有两步。两步,这个数字乍一听有点冒险,但从后面的实验数据看,这个压缩并没有让编辑质量掉太多。
第三步:怎么应对"越编越长之后的崩坏"
前两步解决了因果生成和加速推理的问题,但还剩最后一道坎:长视频。
如果训练时用的都是很短的视频片段(比如几秒钟),模型确实能学会怎么处理短期的因果生成,但它没见过"编辑到第50秒之后会是什么状态"。而现实中,视频流可能持续几十分钟甚至几个小时,短期训练很难覆盖长期运行才会暴露出来的深层错误累积。
这就好比一个新手司机,驾校训练的时候只在小区里绕了几圈,从没跑过长途。等真让他上高速开五六个小时,方向盘握久了手会不自觉地跑偏,注意力也会因为长时间重复动作而松懈,这些问题,只有真的开长途才会暴露,绕小区是绕不出来的。
于是团队引入了长时程自回归蒸馏(Long-Horizon Autoregressive Distillation,简称LHAD)。具体做法是把一个很长的视频片段(论文里叫m-chunk rollout,也就是m个块组成的滚动序列)拆成若干个更短的连续小段,对每一小段单独计算SA-DMD的反向传播梯度,算完立刻清空计算图(避免显存爆掉,也就是常说的OOM,Out of Memory),然后把所有小段的梯度累积起来,做一次统一的参数更新。这样既能让模型"见识"到长视频运行后期才会出现的深层错误状态,又不会因为要保留整段视频的完整计算图而导致显存不够用。
还有一个很实际的小设计:如果训练时想要模拟的"目标长度"超过了手头现有源视频的长度怎么办?团队用了一种叫动态镜像循环(dynamic mirror looping)的策略,简单说就是把视频正着放一遍再倒着放一遍,交替循环,这样可以在不用真的复制粘贴视频内容占用额外存储的情况下,延伸出足够长的"虚拟源视频",而且避免了简单粗暴的循环重复带来的画面突兀跳变。
部署上线:如何真的做到每秒30帧
方法讲完了,接下来看这套系统在真实硬件上跑起来到底是什么速度。
论文给出了详细的耗时拆解:在一块英伟达B200 GPU上,处理每个8帧的视频块,VAE编码耗时22毫秒,DiT去噪耗时185毫秒,VAE解码耗时19毫秒,从请求发出到响应返回,总共226毫秒的延迟。再加上干净KV缓存构建(31毫秒)和伪编码(9毫秒),完整一轮循环是266毫秒,换算成帧率,正好对应30.1 FPS。
> KV缓存(Key-Value Cache):Transformer类模型在自回归生成时的一种加速技巧,把之前计算过的"键值对"信息存起来,后面生成新内容时可以直接复用,不用每次都从头重新计算整段历史,这也是为什么"分块+滑动窗口"的设计能让计算量保持恒定的原因之一。
> FP8量化:把模型内部原本用更高精度(比如32位或16位浮点数)存储和计算的数值,压缩成8位浮点数表示,精度会略微下降,但计算和存储开销大幅降低,是实现实时推理的重要工程手段之一。
为了达到这个速度,团队做了一系列的部署优化:FP8量化降低了计算和存储成本,编译过的VAE计算路径配合自动调优(autotuning)加速了编码解码过程,流水线式的执行让主机端的处理和显卡端的计算可以并行重叠,启动预热、持久化的编译产物和保留的内存池则避免了重复编译和内存分配带来的额外开销。
这些优化叠加起来的效果,在实测对比中体现得很明显。论文给出了在81帧输入、批大小为1的条件下,几个流式编辑方案的延迟和吞吐量对比:
| 方法 | 分辨率 | 完整流程延迟(秒) | 完整流程FPS | VAE延迟(秒) | VAE FPS |
| StreamDiffusionV2 | 480×832 | 4.48 | 18.07 | 2.19 | 37.06 |
| LiveEdit | 480×832 | 5.24 | 15.45 | 2.17 | 37.26 |
| SANA-Streaming | 704×1280 | 5.58 | 14.51 | 2.99 | 27.12 |
| **JoyAI-Video-Edit** | **720×1280** | **2.68** | **30.19** | **0.405** | **200.00** |
值得留意的是,JoyAI-Video-Edit在分辨率更高(720×1280)的情况下,反而做到了最低的完整流程延迟和最高的吞吐量,尤其是VAE处理速度达到了200 FPS,比其他几家快出一大截。这说明它的优势不只是靠单点的算法先进,而是整个系统链路(VAE、DiT、缓存机制、量化方案)协同优化之后的结果。
实验结果:短视频打得过,长视频打得赢
光讲原理不够,我们来看看这套系统到底做得怎么样,是不是真的比其他流式方案强,又是不是真的能追上离线模型的水准。
论文用了两个测试场景。第一个是短视频编辑,用的是公开评测集OpenVE-Bench,覆盖全局风格转换、局部改动、背景替换、局部删除、局部添加五大类任务,由一个多模态大模型(Gemini)当裁判打分,满分5分。
| 方法 | 参数量 | 分辨率 | 综合得分 | 全局风格 | 局部改动 | 背景替换 | 局部删除 | 局部添加 |
| StreamDiffusionV2 | 1.3B | 480×832 | 1.23 | 1.48 | 1.35 | 1.01 | 1.27 | 1.05 |
| SANA-Streaming | 2B | 704×1280 | 2.62 | 3.48 | 2.29 | 3.20 | 2.27 | 1.88 |
| LiveEdit | 1.3B | 480×832 | 2.00 | 2.18 | 2.73 | 2.05 | 1.55 | 1.51 |
| Xmax-X2.0 | — | 832×1440 | 1.87 | 2.47 | 2.09 | 1.63 | 1.73 | 1.41 |
| Bernini-R(离线) | 27B | 480×848 | 3.72 | 4.16 | **4.47** | 3.25 | 3.88 | 2.89 |
| **JoyAI-Video-Edit** | **16B** | **720×1280** | **3.60** | 3.62 | **4.47** | 2.90 | **4.06** | 2.97 |
从数据能看出几个层次。首先,和其他流式方案相比,JoyAI-Video-Edit的综合得分3.60,比第二名SANA-Streaming的2.62高出接近一整分,而且这个差距不是靠某一项冲高拉出来的,是在五个类别里的四个都拿到了流式方案第一。其次,也是更让人意外的一点,它的表现已经追平甚至超过了一部分参数量更大的离线模型。像27B参数的Bernini-R作为离线系统,综合得分3.72,只比JoyAI-Video-Edit高0.12分,而且在局部改动这一项,两者都是并列最高的4.47分。要知道,离线模型可以看到整段视频的过去和未来,JoyAI-Video-Edit只能看到过去,还得在极短时间内实时吐出结果,能做到这个水准并不容易。
第二个测试场景更值得说道,因为它触及了一个此前行业里几乎没人系统测过的盲区:长视频编辑。论文里提到,现有的视频编辑评测集大多是不到10秒的短片段,根本没法用来考察一个模型在长时间运行之后会不会出现质量下滑、误差累积这些问题。于是团队自己搭建了一个新的评测基准,叫LongV2VBench,包含229个任务,覆盖背景替换、全局风格编辑、局部添加、局部修改、局部删除五大类,视频长度统一为一分钟。
> LongV2VBench:论文作者自建的长视频编辑评测基准,专门用来测试模型在处理约一分钟长度视频时,是否还能保持编辑质量的稳定,而不是像很多短视频评测那样只看几秒钟的表现。
在这个更严苛的长时间考验下,结果差距进一步拉开:
| 方法 | 分辨率 | 吞吐量(FPS) | 综合得分 | 背景替换 | 全局风格 | 局部添加 | 局部改动 | 局部删除 |
| StreamDiffusionV2 | 480×832 | 18.07 | 1.21 | 1.08 | 1.71 | 1.18 | 1.11 | 1.03 |
| SANA-Streaming | 704×1280 | 14.51 | 1.64 | 1.19 | 2.02 | 1.50 | 1.72 | 1.85 |
| LiveEdit | 480×832 | 15.45 | 1.23 | 1.10 | 1.34 | 1.33 | 1.34 | 1.04 |
| XMax-X2.0 | 832×1440 | 20.90 | 1.71 | 1.36 | 2.07 | 1.64 | 2.08 | 1.40 |
| **JoyAI-Video-Edit** | **720×1280** | **30.19** | **3.30** | **2.49** | **3.85** | **3.10** | **4.09** | **2.99** |
这组数字才是真正说明问题的地方。**JoyAI-Video-Edit在长视频场景下拿下了3.30的综合分,比第二名XMax-X2.0的1.71分几乎翻了一倍**。
这说明什么?说明其他几家流式方案,虽然在几秒钟的短片段上还能凑合,但一旦拉长到一分钟,编辑质量出现了明显的下滑,这正好印证了前面反复提到的"长期漂移"问题:没有专门针对长时程做优化的模型,跑得越久,画面越容易走样。而JoyAI-Video-Edit靠着SA-DMD和长时程蒸馏这两把刷子,把这个问题压住了。同时它的吞吐量还是最高的,达到30.19 FPS,比分辨率更高的XMax-X2.0还快44.4%,速度和质量没有互相拖后腿。
消融实验:两个关键设计到底谁的功劳更大
光看最终结果还不够过瘾,论文里还专门做了一个拆解实验,把SA-DMD和LHAD(长时程自回归蒸馏)分别单独拿掉,看看各自到底贡献了多少。
| SA-DMD | LHAD | 综合得分 | 背景替换 | 全局风格 | 局部添加 | 局部改动 | 局部删除 |
| — | — | 2.81 | 2.45 | 3.61 | 1.97 | 3.43 | 2.58 |
| ? | — | 3.23 | 2.49 | **4.24** | 2.74 | 4.00 | 2.67 |
| — | ? | 3.06 | **2.60** | 3.56 | 2.49 | 3.94 | 2.70 |
| **?** | **?** | **3.30** | 2.49 | 3.85 | **3.10** | **4.09** | **2.99** |
从这张表能看得很清楚,SA-DMD单独启用之后,全局风格这一项从3.61直接跳到4.24,局部改动从3.43跳到4.00,说明"锚定源视频"这个操作,确实狠狠遏制住了因为长时间自回归导致的画面走样。而LHAD单独启用,主要提升的是背景替换(从2.45到2.60)和局部删除(从2.58到2.70),这两项恰好都是需要长时间保持稳定才能做好的任务类型,说明LHAD瞄准的正是"长视频运行后期状态不稳"这个具体问题。两者一起用,最终拿到3.30的综合最高分,而且在局部添加、局部改动、局部删除这三项局部编辑任务上都是全表最优,证明这两个设计不是简单的叠加,而是真的互相补位,各自解决了对方解决不了的问题。
人类评审:真人打分下的胜负手
自动打分固然客观,但视频质量这种事,终究还是要看人怎么看。论文里还做了一轮人类主观评审,用的是两两对比的方式:把匿名的编辑结果放在一起,让评审员在两个方案之间选一个更好的,或者选平局。
结果显示,JoyAI-Video-Edit对阵LiveEdit时拿下90%的偏好票,对阵SANA-Streaming是87%,对阵XMax-X2.0是81%,对阵StreamDiffusionV2是87%。这几组数据基本上是碾压级别的胜出。
而对阵离线的Bernini-R模型时,双方各拿48%和44%,剩下是平局,可以说打了个平手。对阵Kling-3.0 Omni和Seedance 2.0这两个商业闭源模型时,各自拿到56%的偏好票,也算是稍占上风。
这组人类主观评审的结果,和前面自动评测的结论基本吻合:**在流式实时编辑这个赛道里,JoyAI-Video-Edit是明显的第一名,而放到整个视频编辑领域(包括离线模型)来看,它也已经达到了和顶尖离线系统掰手腕的水准**。
数据从哪儿来:训练背后的功夫
方法和结果讲完了,最后补一笔常常容易被忽略但其实很关键的部分:训练数据是怎么攒出来的。
高质量的"视频编辑配对数据"(也就是一段原始视频加上一段编辑后的目标视频,两两配对)在业内一直是稀缺资源,很难大规模收集。论文里提到,团队想了两条路来解决这个问题。
第一条路是关键帧引导的编辑传播:先从源视频里挑一帧有代表性的画面出来,用图像编辑模型把这一帧改好,然后把改好的这一帧和原始视频一起喂给一个"图像加视频到视频"的模型,让它把这个编辑效果传播扩散到整段视频的其他帧上,同时保持原有的运动轨迹和没被编辑到的内容不变。
第二条路是潜在共享的图生视频生成:从一张原始图片和它编辑后的对应图片出发,用两个分支的图生视频(I2V)模型分别生成视频,这两个分支在早期的去噪阶段共享同一批潜在变量(这样能保证运动和构图一致),到了后期去噪阶段才分别用不同的图片作为条件,从而引入想要的编辑效果。
生成出来的配对数据还要经过一轮筛选:按照画面质量、编辑是否正确、内容是否被过度改动、时间连贯性等标准过滤一遍,之后再用一个多模态大模型去核对源视频和编辑后视频之间的差异,反过来修正和精炼编辑指令的文字描述,相当于给每一条训练数据都做了质检加复核。
打个比方,这有点像做菜谱教学视频。如果你只是随便拍一段做菜过程就拿去当教材,可能里面有失败的步骤、错误的调料比例,学的人反而学歪了。但如果你先请专业厨师把每个关键步骤(关键帧)单独做示范,再把整个过程录下来对照检查,最后请美食评论家(多模态大模型)核实一遍菜谱描述和实际做法是否一致,这样产出的教学素材,质量才靠得住。如果不做这层筛选和核对,直接拿粗糙数据训练模型,模型学到的编辑能力大概率也是歪的。
写在后面
读完这篇论文,最触动我的一点,其实是"长视频漂移"这个问题被真正当回事对待的方式。很多论文提到长期一致性问题时,往往一笔带过,用"未来工作"打发过去。但这篇论文专门搭了一个新的评测基准LongV2VBench去量化这个问题,然后用数据证明了:不做专门优化的话,一分钟的视频编辑质量能比十秒钟的差出一倍不止(对比表里其他方法综合分普遍在1.2到1.7分,远低于短视频测试时的2到3分区间)。这个反差本身就是一个很有价值的发现,它说明行业里此前的"实时编辑"方案,可能大多是在"短平快"的场景下堆出来的成绩,一旦拉到真实的长直播场景,很可能立刻现出原形。
另一个让我觉得有意思的细节是SA-DMD里"只在训练阶段做源锚定,部署阶段单分支推理"这个设计。这种"考前抱佛脚,考试凭记忆"的思路,本质上是把一个推理时的计算负担,提前转移到了训练阶段去消化。这个思路在其他需要平衡"实时性"和"质量"的场景里(比如实时语音翻译、实时人脸重建)应该都有借鉴价值,只是具体怎么把"额外约束"从推理时挪到训练时,每个场景恐怕都得重新设计一遍。
这篇论文没有解决的一个问题,是它依赖16B参数量和B200这样的顶级硬件才跑出30 FPS。等哪天这套方法能塞进一台普通游戏本甚至手机里,视频编辑会不会真的变成人人张口就来的一件事,值得继续追问。
Q&A
Q1:JoyAI-Video-Edit是什么?
A:JoyAI-Video-Edit是京东Joy未来学院提出的一款160亿参数的自回归扩散视频编辑模型,能够在不知道视频总时长的情况下,实时对视频流进行指令引导的编辑,在单块英伟达B200 GPU上可以做到720p分辨率、每秒约30帧的编辑速度。
Q2:JoyAI-Video-Edit和其他实时视频编辑工具比,优势在哪?
A:在短视频编辑评测OpenVE-Bench上综合得分3.60,大幅超过SANA-Streaming、LiveEdit、XMax-X2.0等流式方案,接近甚至持平部分离线大模型;在专门测试长视频的LongV2VBench上综合得分3.30,比第二名高出近一倍,同时吞吐量也是所有对比方案里最高的,达到30.19 FPS。
Q3:JoyAI-Video-Edit是怎么解决长视频编辑质量下降的问题的?
A:主要靠两个关键技术,源锚定分布匹配蒸馏(SA-DMD)让模型在训练时始终参考对齐的原始源视频,抑制自回归生成过程中的漂移;长时程自回归蒸馏(LHAD)通过分段优化让模型在训练阶段就见识到长视频运行后期才会出现的误差累积状态,从而提前学会应对。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.