字节最近介绍了一个中等规模的研究模型,名为Seaweed-7B,该模型从零开始训练,拥有约70 亿参数(7B),共使用了665,000 小时的 H100 GPU。尽管训练资源适中,Seaweed-7B 在性能上仍表现出极强的竞争力,甚至可与当前体量更大的视频生成模型媲美。(链接在文章底部)
尽管该模型表现出良好的潜力,但仍存在若干已知的局限性。首先,在视频基础模型的几乎所有方面仍有大量提升空间。要解决这些挑战,需要科研界与工业界的共同努力,推动数据整理、模型设计以及训练后处理等方向的进步。其次,受限于计算资源,模型在生成精细细节(如小型人脸或精致图案)方面仍存在不足。最后,确保负责任的视频生成是一个亟需关注的研究方向,需要在安全性、公平性和伦理性方面投入更多努力。
01 演示效果
Seaweed 在生成各种景观方面表现出色。它能够创造出细致入微、构图动感十足的视觉环境,从而增强叙事效果。通过一部短片展示了模型的生成能力。所有视频内容均由模型生成,唯一手动添加的部分是背景音乐和片尾字幕。
Seaweed视频生成模型提供了更强大的控制能力,使用户能够精确地创作出他们设想的内容。通过提供一张图像作为第一帧,用户可以引导模型以一致的运动和风格生成后续的视频。这使用户能够完全掌控视觉美感,非常适用于对准确性和创意方向要求较高的应用场景。
Seaweed模型还可以通过微调,根据参考图像生成视频,为用户提供灵活的输入选项。无论是人物参考图、物体参考图,还是多个参考图的组合,模型都能够将其合成为动态的视频序列。
以人为中心的视频生成:Seaweed 结合 Omnihuman 实现基于音频输入的内容生成,能够创作出与音频声音高度契合的真实人物形象。该模型可精准同步嘴型与身体动作,使其与音频的语气和节奏保持一致,从而打造出自然流畅、栩栩如生的互动体验。
生成音频与视频:Seaweed 还能够同时生成音频和视频。生成的音频与视频的动作、场景、语气、节奏和风格同步,确保音频与视频完美契合。音频不仅与视频相辅相成,还能提升视觉叙事,提供无缝的多媒体体验。
一致的叙事:Seaweed 能够生成一致的、多镜头的长篇故事,保持场景和镜头之间的连贯性。用户可以提供整体叙事的全局文本描述,以及每个独立镜头的细致文本描述。
高分辨率生成:Seaweed 原生支持生成最高 1280x720 分辨率的视频。生成的结果也可以进一步上采样到 2K QHD(2560x1440)分辨率。
世界探索:Seaweed 可用于通过定义的轨迹建模精确的相机控制,不仅提供了更强的创意指导,还为用户提供了一种互动方式来探索模拟世界。
https://seaweed.video/seaweed.pdf欢迎交流~,带你学习AI,了解AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.