网易首页 > 网易号 > 正文 申请入驻

CVPR 2026 生成式 AI 观察梳理:视觉模型开始重写默认设定

0
分享至


从扩散控制到语义泛化,视觉 AI 进入范式重构期。

作者丨郑佳美

编辑丨岑 峰

过去几年,视觉生成与视觉理解领域的技术推进,整体上始终沿着一条相对明确的路径展开:当一套建模范式被验证有效之后,后续的大量工作往往都会围绕这套既有框架持续做模型扩容、训练增强、采样优化与局部模块修补,以此换取更高的性能上限。

无论是扩散生成、视频 world model,还是动作建模与视觉匹配,主流研究在很长时间里都更多表现为对既有系统的持续加固,而不是对底层假设本身的重新审视。

但从今年 CVPR 集中出现的一批代表性工作来看,这种相对稳定的技术推进逻辑正在发生值得警惕的变化。越来越多研究已经不再满足于在现有模型框架内部继续做增量式性能修补,而是开始系统性地把问题重新拉回到那些长期被工程实践视为“默认正确”的基础设定上。

扩散模型中的引导机制是否真的合理,视频生成是否必须建立在 diffusion 的反复去噪之上,生成模型所学习的预测对象是否从一开始就遵循了最自然的数据流形,以及人体动作生成与语义对应任务中长期被粗粒度评价掩盖的控制边界和泛化边界,是否都需要被重新定义。

这意味着,顶会论文所呈现出的竞争重点正在悄然发生迁移。相比于过去更多强调“在原有范式内把模型做得更强、把指标推得更高”,这一批工作更值得注意的地方在于,它们开始同步触碰那些决定模型行为方式的底层建模前提,并试图重新建立新的生成目标、控制机制、主干架构与表示逻辑。

换句话说,视觉 AI 的下一轮竞争,正在逐渐从性能增量竞争,转向对既有默认设定的回溯性重写。

01


视觉生成开始重写基础机制

这一趋势首先体现在由上海交通大学和 vivo BlueImage Lab 共同提出的《C²FG: Control Classifier-Free Guidance via Score Discrepancy Analysis》上。


论文地址:https://arxiv.org/pdf/2603.08155v2

Classifier-Free Guidance(CFG)作为条件扩散模型中最常用的生成引导机制,几乎已经成为默认组件:通过调节 conditional 分支和 unconditional 分支之间的 guidance strength 来增强模型对条件信息的服从程度,从而提升生成质量。

但长期以来,这一过程主要依赖固定 guidance weight 或少量经验化动态调整,真正的问题在于,扩散过程内部的噪声结构和 score 差异并不是静止的,而是随着时间步不断变化,固定的引导强度很难在整个采样阶段都保持最优。

论文正是从这一被忽视的内部动力学出发,分析不同 timestep 下 conditional score 与 unconditional score 的 discrepancy 变化规律,指出 guidance scale 本质上不应是一个静态超参数。

基于这种理论观察,作者提出 C²FG(Control Classifier-Free Guidance),利用指数衰减控制函数让 guidance strength 在采样前期和后期自动完成动态分配:前期更强地利用条件约束保证语义对齐,后期则逐步减弱引导以避免过强 guidance 带来的分布偏移和细节失真。

它真正打破的是 CFG 长期依赖经验调参的惯性,把一个原本“手工设定的 scale”重新建立成一个与扩散动力学同步变化的控制变量,而且由于整个方法 training-free、plug-in,无需重新训练模型即可直接嵌入现有采样流程,这也使它具备了非常强的工程可迁移性。


而当扩散模型内部的引导控制开始被重新理论化时,苹果团队提出的《STARFlow-V: End-to-End Video Generative Modeling with Autoregressive Normalizing Flows》则进一步把问题推向了更底层的生成架构本身。

当前高质量视频生成几乎清一色建立在 diffusion 框架之上,反复去噪似乎已经成为视频 world model 的默认实现方式,normalizing flow 虽然在图像生成中重新受到关注,却始终没有真正进入视频生成主流。


论文地址:https://arxiv.org/pdf/2511.20462v2

STARFlow-V 试图回答的是:高质量视频生成是否真的只有 diffusion 这一条路。为此,论文并没有简单把图像 flow 结构迁移到视频,而是针对视频生成的长时序依赖和跨帧一致性,在时空 latent 空间中重新构建了一套 global-local 的 autoregressive normalizing flow 架构:

全局 latent 用于控制跨帧因果依赖,减少长视频中误差逐帧累积的问题,局部 latent 则保留帧内细节交互,保证空间纹理质量。

同时,作者进一步引入 flow-score matching,通过轻量级 causal denoiser 提升自回归生成过程中的时间一致性,并利用 video-aware Jacobi iteration 提高内部更新的并行效率。

也就是说,它并不是在 diffusion 框架内继续做采样优化,而是直接打破“高质量视频生成必须依赖 diffusion 反复去噪”的默认前提,建立起一种基于 normalizing flow 的端到端视频生成范式。

更重要的是,由于 flow 天然具备可逆结构和显式 likelihood 估计能力,同一个 STARFlow-V 模型就能够原生支持 text-to-video、image-to-video 以及 video-to-video 多种任务,不需要为不同任务额外堆叠复杂分支,这使它不仅是一个替代架构,更像是在重新打开视频生成的技术路线图。


如果说前两篇工作还主要集中在“生成过程如何被重新控制与重新实现”,那么由 MIT 团队提出的《Back to Basics: Let Denoising Generative Models Denoise》则把审视进一步推回到扩散模型最核心的预测对象上。

当前主流 denoising diffusion model 虽然名义上是“去噪生成模型”,但大多数做法实际上并不直接预测干净图像,而是让模型去拟合噪声残差或带噪中间量,这一设定在工程上已经沿用多年,却很少有人重新追问它是否真的是最合理的生成目标。


论文地址:https://arxiv.org/pdf/2511.13720v2

他们的研究指出,按照流形假设,自然图像分布位于相对低维且连续的数据流形,而噪声空间则高维、分散且更难拟合;从这个角度看,让模型直接学习回到 clean data,本身可能比在高维噪声空间中预测 noised quantity 更自然、更稳定。

基于这一认识,作者提出 JiT(Just image Transformers),不再依赖额外 tokenizer、复杂预训练模块或辅助损失,而是直接使用大 patch Transformer 在原始像素空间完成 clean image 预测。

这个设计表面上看是“回归朴素”,但它真正打破的是“扩散模型默认预测噪声”的路径依赖,重新建立起一种以直接回归数据流形为核心的生成思路,也让 Transformer-based diffusion 在高分辨率自然图像上的建模逻辑变得更加自洽。


02


生成模型开始从「会生成」走向「会精确编排」

当视觉生成模型不断回到底层机制做重构时,另一部分工作则开始把注意力转向“模型生成结果到底能被控制到什么程度”。由德国图宾根大学、Tübingen AI Center 以及马克斯·普朗克信息学研究所共同提出的《FrankenMotion: Part-level Human Motion Generation and Composition》就是其中非常典型的一例。

当前文本驱动人体动作生成虽然已经能够根据整体动作描述生成相对自然的人体运动,但模型控制依然停留在粗粒度层面:它能理解“一个人在走路”“一个人在挥手”,却很难精确回答“左手什么时候抬起”“下半身何时转向”“动作切换发生在哪一帧”。


论文地址:https://arxiv.org/pdf/2601.10909v1

造成这一问题的核心原因,一方面在于现有 mocap 数据大多只有序列级动作标签,缺少按时间对齐、按身体部位拆分的细粒度标注;另一方面,模型即使理解整体语义,也很难同时兼顾局部肢体动作与全局时序一致性。

FrankenMotion 正是重新把复杂人体运动视为由多个“原子动作单元”组成,并尝试让模型学习这些身体部位级动作之间的组合关系。

论文首先借助 FrankenAgent 自动为已有动作序列生成逐帧、逐身体部位且时间对齐的层级文本标注,构建新的 FrankenStein 数据集;随后训练 FrankenMotion 同时接收序列级、动作级和身体部位级条件,使模型不仅知道“做什么动作”,还知道“哪部分身体在什么时候做”。

这意味着人体动作生成开始从“生成一个合理动作片段”转向“按指令精确编排复杂动作组合”,模型能够组合出训练集中并未直接出现过的细粒度复合动作。

与这种细粒度控制需求相对应,视觉理解中的匹配任务也在经历类似的范式转向。由意大利都灵理工大学、TU Darmstadt、hessian.AI 以及 ELIZA 共同提出的


由而意大利都灵理工大学(Politecnico di Torino)、德国达姆施塔特工业大学(TU Darmstadt)、德国黑森州人工智能研究院(hessian.AI)以及 ELIZA 共同提出的《MARCO: Navigating the Unseen Space of Semantic Correspondence》。

关注的则是语义对应(semantic correspondence)里一个很现实却常被 benchmark 掩盖的问题:现有方法虽然在已标注关键点上精度很高,但一旦查询点超出训练时见过的关键点位置,或者遇到未见类别,泛化能力就会迅速下降,导致 benchmark 成绩与真实可用性之间存在明显落差。


论文地址:https://arxiv.org/pdf/2604.18267v1

当前主流语义对应模型通常采用 DINOv2 加 diffusion backbone 的双编码器架构,虽然效果强,但模型规模接近十亿参数,计算开销大,而且依赖稀疏关键点监督时很难学到真正连续、致密的语义匹配关系。

MARCO 的核心切入点,就是不再满足于“在标注点上对得准”,而是尝试让模型学会在未被标注的空间中也能推断合理的对应关系。

为此,论文在 DINOv2 基础上构建了一个更统一、更轻量的对应框架,并结合 coarse-to-fine 的定位目标提升细粒度空间精度,同时引入一种 dense self-distillation 机制,把原本稀疏的关键点监督逐步扩展成更致密的语义对齐信号。

这种设计带来的变化在于,模型不只是记住训练时出现过的对应点,而是开始学习物体表面更连续的结构关联,因此在 unseen keypoints 和 unseen categories 上都表现出更强泛化能力。

实验结果显示,MARCO 不仅在 SPair-71k、AP-10K、PF-PASCAL 等标准基准上刷新了性能,在更严格的细粒度定位阈值和未见关键点测试中提升尤其明显;与此同时,它相比 diffusion-based 方法还实现了约3 倍更小10 倍更快的效率优势。

这篇工作的价值在于,它打破了语义对应领域长期“高 benchmark 分数 ≠ 强真实泛化”的隐性瓶颈,建立起一种更强调致密推断和未见空间泛化的建模思路,使 semantic correspondence 从“在标注点上匹配”,进一步走向“在整片语义空间中寻找对应”。


把这几项工作放在一起看,会发现它们虽然分别来自扩散控制、视频生成、人体动作生成和语义对应等不同方向,但背后其实共享着同一条更深层的研究脉络:视觉 AI 正在从“沿着既定范式堆模型、调参数、刷 benchmark”,转向“重新拆掉那些被默认正确的底层设定,再建立新的生成目标、控制机制和表示方式”。

有的工作在重新定义扩散模型应该如何引导,有的在重新打开视频生成不止 diffusion 一条路的可能性,有的在追问生成模型到底该预测噪声还是直接预测数据流形,也有的在把模型控制粒度和泛化空间从粗粒度推进到更连续、更真实的层面。

换句话说,真正值得注意的已经不只是某一个模型分数提升了多少,而是这一批工作共同释放出的信号:视觉模型的下一轮竞争,正在从性能增量竞争,转向底层建模范式的重构竞争。

这次去 CVPR 现场,一定不要错过

【认识大牛+赚外快】的机会

需要你做什么:把你最关注的10个大会报告,每页PPT都拍下来

你能获得什么?

认识大牛:你将可以进入CVPR名师博士社群;

钱多活少:提供丰厚奖金,任务量精简;

听会自由:你的行程你做主,顺手就把外快赚。拍下你最感兴趣的10个报告PPT即可。

如果你即将前往CVPR,想边听会边赚钱,还能顺便为AI学术社区做贡献、认识更多大牛,欢迎联系我们:[添加微信号:MS_Yahei]

【限额5位,先到先得】

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
小米增程器宣传引质疑,大众EA211对比:同支持多油品,还有整车终身质保

小米增程器宣传引质疑,大众EA211对比:同支持多油品,还有整车终身质保

报错免疫体
2026-07-29 09:04:32
太露骨了!两个人的疯狂毁了两个家庭,陪读女家长出轨“最美教师”,直言“我的心和我的身体都离不开你”

太露骨了!两个人的疯狂毁了两个家庭,陪读女家长出轨“最美教师”,直言“我的心和我的身体都离不开你”

火山詩话
2026-07-31 07:21:19
一天之内,我国外交部两大人事调整,刘劲松宣布离任,信号不简单

一天之内,我国外交部两大人事调整,刘劲松宣布离任,信号不简单

墨兰史书
2026-07-31 03:20:03
央企也扛不住了?一张红头文件疯传背后,比“全员免职”更扎心的是这件事

央企也扛不住了?一张红头文件疯传背后,比“全员免职”更扎心的是这件事

不打灰的石总工
2026-07-31 11:30:17
原来她就是潘涛的妻子!难怪能稳坐央视一哥,真是有个贤妻旺三代

原来她就是潘涛的妻子!难怪能稳坐央视一哥,真是有个贤妻旺三代

新时代精神
2026-07-28 01:25:01
乔治·克鲁尼撤离法国住所,致信市长:“我们不知道美丽的家能否挺过这可怕时刻”

乔治·克鲁尼撤离法国住所,致信市长:“我们不知道美丽的家能否挺过这可怕时刻”

我是一个养虾人
2026-07-30 15:04:24
库里+约基奇!不急于今夏,勇士等待2027年交易截止日酝酿大交易

库里+约基奇!不急于今夏,勇士等待2027年交易截止日酝酿大交易

夜白侃球
2026-07-31 13:04:37
再掏55亿美元扩建!云顶老板林国泰的纽约豪赌

再掏55亿美元扩建!云顶老板林国泰的纽约豪赌

福布斯
2026-07-30 19:57:18
不可思议!菲尔兹奖得主王虹的领英主页好友400多人,动态空白,没有长串头衔,连过往战绩都很少提及

不可思议!菲尔兹奖得主王虹的领英主页好友400多人,动态空白,没有长串头衔,连过往战绩都很少提及

火山詩话
2026-07-30 08:00:50
8月1日开始!腾讯 爱奇艺又有5部大剧来袭,全是老熟人,想不火都难

8月1日开始!腾讯 爱奇艺又有5部大剧来袭,全是老熟人,想不火都难

喜欢历史的阿繁
2026-07-31 00:28:49
1939年,王光美在大学里留影,18岁的她气质不凡,一看就家世显赫

1939年,王光美在大学里留影,18岁的她气质不凡,一看就家世显赫

凉州辞
2026-07-28 13:00:03
央企也扛不住了?一张红头文件疯传:全员免职、零赔偿套路曝光

央企也扛不住了?一张红头文件疯传:全员免职、零赔偿套路曝光

陌小尘桑
2026-07-27 14:19:59
仅48小时又创历史记录!2大冠军后卫驰援76人?湖人低估詹姆斯了

仅48小时又创历史记录!2大冠军后卫驰援76人?湖人低估詹姆斯了

小路看球
2026-07-30 14:47:21
拳王老婆喜欢骗钱!文艺女星被棒子国财阀追捧!

拳王老婆喜欢骗钱!文艺女星被棒子国财阀追捧!

八卦疯叔
2026-07-31 11:45:03
立秋前后一波好运来袭的3大生肖,人面桃花,财运不断,心想事成

立秋前后一波好运来袭的3大生肖,人面桃花,财运不断,心想事成

毅谈生肖
2026-07-31 12:11:08
解放军判断没有错,台军果然出事了

解放军判断没有错,台军果然出事了

少女心盗梦贼
2026-07-27 05:09:22
媒体人:北京首钢有意求购青岛小外援韦瑟斯庞的优先续约权

媒体人:北京首钢有意求购青岛小外援韦瑟斯庞的优先续约权

狼叔评论
2026-07-31 14:16:01
上海大师赛半决赛签表赛程,对阵双方历史交手记录和对战前景分析

上海大师赛半决赛签表赛程,对阵双方历史交手记录和对战前景分析

天涯远行人
2026-07-31 01:20:17
浙江嘉兴两渔船深夜电鱼,目击者很无奈,当地钓友:鱼越来越少了

浙江嘉兴两渔船深夜电鱼,目击者很无奈,当地钓友:鱼越来越少了

大豫生活
2026-07-31 10:44:11
为争冠拼了:哈登推迟新合同只为等一人

为争冠拼了:哈登推迟新合同只为等一人

本泽体育
2026-07-31 14:16:20
2026-07-31 15:00:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7511文章数 20771关注度
往期回顾 全部

科技要闻

最多80%!GPT5.6官宣降价,中国厂商逼的?

头条要闻

为救患癌母亲 上海医生走危险"野路子":狗急了都跳墙

头条要闻

为救患癌母亲 上海医生走危险"野路子":狗急了都跳墙

体育要闻

欧足联掀桌!因凡蒂诺这次真玩大了?

娱乐要闻

李小璐澄清夜宿门,被网友质疑想洗白

财经要闻

打新日确认!宇树科技IPO冲刺“冰与火”

汽车要闻

MG 07将是上汽的逆转时刻

态度原创

手机
家居
亲子
本地
旅游

手机要闻

重新定义苹果外接存储 aigo PL系列登陆ChinaJoy现场首发

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

巨婴”当父母太可怕了

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

旅游要闻

重庆老城区最低调的北碚公园,竟还藏着国宝大熊猫名字的起源密码

无障碍浏览 进入关怀版