只用少量合成视频做训练,一个基于视频生成模型的系统就在深度估计、语义分割、3D姿态估计这些经典视觉任务上,跟各自领域最好的专用模型打成了平手。这个名为GenCeption的模型来自Google DeepMind,核心思路很反直觉:生成视频这件事,本就逼着模型学会了理解空间几何、物体运动和物理常识,把这种“副产品”拿出来做感知任务,数据需求反而远低于从头定制架构。
计算机视觉长期以来一直缺一个像语言模型那样“预测下一个词”的通用预训练任务。分割有SAM,深度估计有Depth Anything,每个任务都独占一套架构和训练流水线。DeepMind团队在新论文里直接打了个比方:如果生成逼真视频需要模型内化一套物理世界模型,那这个视频生成器本身,或许就是视觉领域一直没能找到的那种通用底座。
![]()
GenCeption的工程实现走了一条相当取巧的路径。它把阿里开源视频模型Wan2.1的扩散过程精简成单次前向预测——不用一步步从噪声里迭代,而是一次出结果,速度快到能扛住实际的视觉任务。更有意思的是它的输出形式:不管任务是预测深度图、表面法线图还是分割掩码,结果全都被表示成一张标准的三通道RGB图像。就连相机运动也被编码成图像表示。这一来,一个视频生成模型的原生输出接口,无需大改就能承接五六种完全不同的事。
模型怎么知道当前算哪一题?答案是用一句文本提示。就像跟聊天机器人说“请帮我标出深度”那样,GenCeption凭提示词切换任务模式。对于不能直接画成图的输出——比如预测3D关键点坐标——团队就外挂少量可训练模块,但主干的视频生成模型保持不变。训练时所有任务共用一个损失函数,没有为每个任务单独调结构,这也是数据效率极高的原因之一。
实验部分花了很大力气验证泛化能力。在合成数据上训出来的GenCeption,直接拿到真实拍摄的场景里照样好使;甚至在它从没见过的动物类别上也能稳定迁移,相当于模型真从视频里抽象出了某种通用的结构理解,而不是背下了特定纹理。论文作者毫不讳言,这个结果从侧面支撑了一个至今吵成一团的观点:视频生成器天然内建了世界模型,用它做视觉感知任务的基底完全走得通。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.