Google I/O 2026上,谷歌发布了新一代原生多模态AI模型Gemini Omni,专为视频生成与编辑打造。这一模型取代了此前的Veo系列,将文本、图像、视频和音频的输入整合到单一提示中,为开发者和创作者提供了更连贯的工作流程。
与以往依赖多个独立模型拼接完成项目的做法不同,Omni允许用户在一次提示中同时输入多种模态内容。这意味着创作者不再需要在不同工具间切换,而是可以在一个统一的AI环境中完成从构思到成片的完整流程。
![]()
对话式编辑:不推翻重来
Omni的核心能力之一是对话式编辑。如果生成结果不理想,用户无需从头开始。你可以直接告诉模型“保持电影级灯光,把背景换成日落”,模型会在保留核心素材的同时更新场景。这种迭代方式大幅降低了视频创作中的试错成本。
音频合成与数字水印
在音频方面,Omni能在单次生成中同步完成视觉与音频的匹配,包括将唇形与上传的录音对齐,或即时生成高质量背景音乐。此外,每个生成的720p片段都带有谷歌的SynthID隐形数字水印,用于确保内容真实性和AI安全治理。
与Google Flow的整合
开发者可以将生成的素材直接导入Google Flow,将AI提示环境作为头脑风暴空间,Flow则作为最终的时间线剪辑工作室。这种设计让AI生成与专业剪辑之间的衔接更加顺畅。
在GDG Calabar的实践
作者在GDG Calabar的开发者社区活动中展示了Omni的实际应用。现场演示了如何将Omni作为“数字拼贴”工具——用智能手机录制快速旁白、拍摄参考照片,然后将这些素材一并输入提示,生成连贯的视频资产。Calabar的开发者社区对这类能加速构建和扩展创意的工具表现出浓厚兴趣。
这次活动也引发了一个更广泛的思考:数字包容不仅意味着提供网络接入,更意味着提供创造工具的使用机会。当开发者社区能够掌握像Gemini Omni这样的前沿工具时,技术门槛的降低将让更多人参与到内容创作中来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.