谷歌(Google)近日采取了一项重大战略调整,通过 Google Vids 将 AI 视频生成功能面向所有用户免费开放。依托强大的 Gemini Omni 1.1 Flash 模型,用户现在可以快速创建动态短片、延长场景并精确控制帧插值,这使其成为一个高效且易用的创作工具,与追求电影级高保真度的 Veo 系列形成互补。

视听内容创作领域刚刚迎来了一次面向大众的飞跃。谷歌不再将视频生成技术限制在封闭环境或企业付费计划中;现在,任何拥有谷歌账号的用户都可以体验 Gemini Omni 1.1 Flash 的强大功能。

背景知识:从 Veo 到 Omni Flash

在此之前,谷歌的重点在于 Veo,这是一个旨在实现极致电影画质的模型,但其处理时间较长。而 Gemini Omni 1.1 Flash 的到来标志着一种范式转移:它优先考虑迭代速度和精准的创意控制,使工作流变得像对话一样自然且快速,非常适合需要在几分钟内将创意转化为原型的创作者。

全面掌控:超越简单的提示词

与许多结果具有随机性的视频生成器不同,Google Vids 引入了专业级技术工具。其中,帧插值 (Frame Interpolation) 功能允许用户定义动作的起点和终点,由 AI 生成中间的过渡画面,从而确保完美的缩放效果和相机轨道运动。

Gemini Omni 1.1 Flash 技术规格
  • 时长:基础片段 3-10 秒,最高可扩展至 40 秒。
  • 一致性:分析前一片段的 10 秒内容,以避免视觉跳跃。
  • 参考:支持最高 3 秒的参考视频以复制风格。
  • 分辨率:原生 720p,支持超分辨率提升至 1080p 和 4K。
  • 草稿模式:360p 分辨率(比标准渲染快 60%)。
  • 安全性:通过 SynthID 嵌入不可见水印。

工作流与易用性

Google Vids 不仅仅是一个片段生成器,而是一个完整的基于转录文本的编辑器。它允许集成库存素材、录制屏幕和音频,并能将最长 30 分钟的视频以宽屏、竖屏或正方形格式直接导出到 YouTube。此外,通过与 Adobe Firefly 的整合以及 Google AI Studio API 的开放,该模型的能力也扩展到了外部开发者手中。

未来技术展望

据相关消息,未来 Gemini 3.8 Flash-Lite 的集成 可能会实现根据剧本自动生成 100 多种语言的自然配音,这将 大概率使 Vids 变成一个全自动的生产工具。或许接下来的步骤 将是实现交互式演示的实时视频生成,从而 有可能取代传统的静态演示文稿工具。