网易首页 > 网易号 > 正文 申请入驻

Self-Forcing++:让自回归视频生成模型突破 4 分钟时长极限

0
分享至



本工作由加州大学洛杉矶分校与字节 Seed 等团队联合完成。

在扩散模型持续引领视觉生成浪潮的今天,图像生成早已臻于极致,但视频生成仍被一个关键瓶颈困住——时长限制。目前多数模型还停留在数秒短视频的生成,Self-Forcing++让视频生成首次跨入4 分钟高质量长视频时代,且无需任何长视频数据再训练。先展示一段 100 秒的生成视频:



  • 论文标题:Self-Forcing++: Towards Minute-Scale High-Quality Video Generation
  • 论文地址:https://arxiv.org/abs/2510.02283
  • 项目主页:
  • https://self-forcing-plus-plus.github.io
  • 代码:https://github.com/justincui03/Self-Forcing-Plus-Plus

研究背景:

为什么长视频生成如此困难?

在扩散模型驱动的视觉生成领域,从 Sora、Wan、Hunyuan-Video 到 Veo,视频模型正不断逼近真实世界。然而几乎所有主流模型都有一个共同限制:只能生成数秒的短片段。

这背后的原因在于架构层面的「先天缺陷」:

  • Transformer 的非因果性—— 传统扩散 Transformer (DiT) 需要同时看到所有帧,无法自然地逐帧扩展;

  • 训练-推理不匹配—— 模型在训练时只见过 5 秒短片,却在推理时要生成几十秒甚至几分钟;

  • 误差累积—— 教师模型在每一帧提供强监督,但学生模型在长序列中没有应对逐步误差的能力;

  • 过曝与冻结—— 长时间生成后常出现画面静止、亮度漂移、运动中断等「灾难性崩塌」。

这些问题共同导致:即使最先进的自回归视频扩散模型,也难以在 10 秒以上保持画面一致与运动连贯。

核心思想:

教师模型即世界模型

Self-Forcing++ 的关键洞察是:

  • 教师模型虽然只会生成 5 秒视频,但它依然掌握纠错长视频失真的能力。

研究者利用这一点,让学生模型先自己生成长视频(即使这些视频已经开始「崩坏」),再用教师模型来纠正它的错误。

经过这种「生成→失真→再纠错→再学习」循环,模型逐步学会了在长时间尺度下自我修复和稳态生成。这一机制让 Self-Forcing++ 无需任何长视频标注,就能把生成时长从 5 秒扩展到 100 秒,甚至 4 分钟 15 秒(达到位置编码极限的 99.9%)。

技术解析:

关键的三步让模型稳定生成超长视频



1️⃣反向噪声初始化(Backward Noise Initialization)

在传统短视频蒸馏中,模型每次都从随机噪声生成。

Self-Forcing++ 改为在长视频 roll-out 后,把噪声重新注入到已生成的序列中,使后续帧与前文保持时间连续性。

这一步相当于让模型「重启但不失忆」,避免时间割裂。

2️⃣扩展分布匹配蒸馏(Extended DMD)

作者将原本只在 5 秒窗口内进行的教师-学生分布对齐,扩展为滑动窗口蒸馏:

学生先生成 100 秒长视频 → 随机抽取其中任意 5 秒片段 → 用教师分布校正该片段。

这样,教师不必生成长视频,也能「局部监督」学生的长序列表现,从而实现长期一致性学习。

3️⃣滚动 KV 缓存(Rolling KV Cache)

以往自回归模型(如 CausVid)在推理时使用滚动缓存,但训练时却仍用固定窗口,造成严重偏差。

Self-Forcing++在训练阶段也同步采用滚动缓存,实现真正的训练-推理对齐,彻底消除了「曝光漂移」和「帧重复」的问题。

进一步优化:

强化学习加持的时间平滑

在部分极长视频中,模型仍可能出现突然跳帧或场景突变。

研究者借鉴强化学习中的Group Relative Policy Optimization (GRPO)框架,引入光流平滑奖励(Optical-Flow Reward),让模型通过惩罚光流突变来学习更自然的运动过渡。结果显示:光流方差显著下降,视频流畅度显著提升。整体的算法可以归纳为下面的流程。

实验结果:

在 50、75 和 100 秒的视频生成评测上全面超越基线

测试设置

  • 模型规模:1.3B 参数(与 Wan2.1-T2V 相同)
  • 对比方法:CausVid、SkyReels-V2、MAGI-1、Self-Forcing 等
  • 评估指标:VBench + 新提出的 Visual Stability(视觉稳定性)

主要成果

以下表格展示的是在 VBench 上和使用 Gemini-2.5-pro (Visual Stability) 上的测试结果。





如下图所示,在 0-100 秒的生成结果上,Self-Forcing++ 都能保持很好的稳定性,基线模型大多数都会经历严重的质量下降,比如过曝光和错误累积。



可视化展示:

更多的超长视频展示

在这些长视频中,Self-Forcing++ 始终保持稳定亮度与自然运动,视觉效果几乎无明显劣化。

Scaling 现象:

训练算力 ×25 → 255 秒视频

作者进一步探究「算力与时长」关系,在可视化生成过程中有以下发现:



这说明可能无需长视频数据,只要扩展训练预算,即可延展生成时长。

局限与展望

虽然自回归视频生成已经能达到分钟级别,但是目前依旧有以下问题有待提高:

  • 长时记忆缺失:极长场景下,仍可能丢失被遮挡物体的状态;
  • 训练效率较慢:自回归训练成本高,比 teacher-forcing 训练速度慢。

更多演示视频和我们的方法请参考我们的主页。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
高速统一限速3月26日正式落地!五档限速+清理非标不会再乱扣分!

高速统一限速3月26日正式落地!五档限速+清理非标不会再乱扣分!

沙雕小琳琳
2026-03-26 09:41:30
万科高管被要求退还薪酬

万科高管被要求退还薪酬

地产微资讯
2026-03-26 12:22:04
砸6700亿建雄安,面积抵3个纽约,如今究竟咋样了?

砸6700亿建雄安,面积抵3个纽约,如今究竟咋样了?

娱乐圈的笔娱君
2026-03-26 12:15:32
联大通过决议,宣布“最严重反人类罪”

联大通过决议,宣布“最严重反人类罪”

澎湃新闻
2026-03-26 11:03:06
我国航空发动机领域著名专家严红病逝,年仅57岁

我国航空发动机领域著名专家严红病逝,年仅57岁

澎湃新闻
2026-03-26 11:40:26
中共中央批准,开除刘慧党籍

中共中央批准,开除刘慧党籍

新京报
2026-03-26 17:14:17
张雪峰付幸多张合影被扒,每次团建她都偷瞄张雪峰,眼神满是崇拜

张雪峰付幸多张合影被扒,每次团建她都偷瞄张雪峰,眼神满是崇拜

古希腊掌管松饼的神
2026-03-26 16:52:30
原来她是张雪峰前妻,90后历史学博士‌,两人离婚后曾一起上节目

原来她是张雪峰前妻,90后历史学博士‌,两人离婚后曾一起上节目

大铁猫娱乐
2026-03-25 13:03:57
Manus的两名联合创始人被告知不要离开中国

Manus的两名联合创始人被告知不要离开中国

新浪财经
2026-03-26 13:50:59
4月1日医保7号令落地!1965-1985年出生的,这6件事务必抓紧办

4月1日医保7号令落地!1965-1985年出生的,这6件事务必抓紧办

混沌录
2026-03-25 15:50:11
4个LV包都是假的!女子送检后傻眼:全在专柜买的啊,最新回应

4个LV包都是假的!女子送检后傻眼:全在专柜买的啊,最新回应

半岛晨报
2026-03-25 15:30:03
特朗普警告伊朗在和平协议问题上“认真起来”

特朗普警告伊朗在和平协议问题上“认真起来”

界面新闻
2026-03-26 19:29:30
我有一个朋友在张雪峰公司上班他说张雪峰根本不是大家看到的样子

我有一个朋友在张雪峰公司上班他说张雪峰根本不是大家看到的样子

乐悠悠娱乐
2026-03-26 10:27:07
四川某设计院爆大瓜!

四川某设计院爆大瓜!

黯泉
2026-03-26 18:36:06
厦门一女子长期遭家暴离家不敢归,丈夫向法院申请宣告其死亡,十多年后决心离婚才知道自己“死了”!

厦门一女子长期遭家暴离家不敢归,丈夫向法院申请宣告其死亡,十多年后决心离婚才知道自己“死了”!

环球网资讯
2026-03-26 14:44:08
引而不发才是王道,封锁霍尔木兹海峡,伊朗打完了最后一张牌……

引而不发才是王道,封锁霍尔木兹海峡,伊朗打完了最后一张牌……

家传编辑部
2026-03-26 10:34:27
网易号平台每日辟谣公告(三月二十六日)

网易号平台每日辟谣公告(三月二十六日)

网易号官方平台
2026-03-26 18:04:59
广东一男子买啤酒抽中电动车大奖,将中奖二维码发网上询问后被他人扫走核销,网友:“这下又上了一课”

广东一男子买啤酒抽中电动车大奖,将中奖二维码发网上询问后被他人扫走核销,网友:“这下又上了一课”

洪观新闻
2026-03-26 10:56:49
美国悬赏1000万美金,通缉一中国四川小伙,他到底做了什么?

美国悬赏1000万美金,通缉一中国四川小伙,他到底做了什么?

趣文说娱
2026-03-26 18:11:01
泰国征兵广告用张凌赫做海报:想像“武安侯”一样帅气骑马吗?今年四月报名参军 选择骑兵部队

泰国征兵广告用张凌赫做海报:想像“武安侯”一样帅气骑马吗?今年四月报名参军 选择骑兵部队

闪电新闻
2026-03-26 17:45:38
2026-03-26 20:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12608文章数 142594关注度
往期回顾 全部

科技要闻

Meta高管狂分百亿期权,700名员工却下岗

头条要闻

张雪峰留巨额遗产:二婚妻子或拿50% 剩下的女儿占1/3

头条要闻

张雪峰留巨额遗产:二婚妻子或拿50% 剩下的女儿占1/3

体育要闻

申京努力了,然而杜兰特啊

娱乐要闻

刘晓庆妹妹发声!称姐姐受身边人挑拨

财经要闻

油价"驯服"特朗普?一到100美元就TACO

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

艺术
时尚
本地
旅游
数码

艺术要闻

哪一座桥不是风景?

上新|| 她们说,找到了自己的人生裙子!

本地新闻

救命,这只酱板鸭已经在我手机复仇了一万遍

旅游要闻

20元人民币背景观景台乱收费?景区通报:不存在封闭管控、强制收费等

数码要闻

小米Book Pro 14超薄设计引爆市场!这家国产厂商立功了

无障碍浏览 进入关怀版