GEO资讯

谷歌开放Gemini Omni Flash,视频生成对话化

发布于 2026/8/26 50 次阅读
谷歌开放Gemini Omni Flash,视频生成对话化

谷歌把视频生成,做成了"对话"

8 月上旬,Google 通过官方博客和开发者公告,开放了 Gemini Omni Flash 的访问。它是 Gemini Omni 家族的第一个版本,主打"像聊天一样"生成和编辑视频。和此前的 Veo 偏重"输入一句话出一段片子"不同,Omni Flash 的重点是"反复改"——你可以用自然语言持续调整成片,而不必每次从头生成。从产品定位看,谷歌是想把视频生成从"专业工具"拉进"日常协作",让不会剪辑的人也能快速产出可改的素材。

它到底能做什么

文本、图片、视频、音频都能当输入

用户可以用一句话生成 3 到 10 秒的 720p 视频,把静态图片变成动画,或者用自然语言反复修改成片——换镜头、改天气、做风格迁移。它也能调用 Gemini 对现实世界的常识(比如建筑风格、生物特征)来补全画面,不用你写满三页 Prompt。官方演示里,一个主体能围绕约 20 个视角生成多机位画面。

开发者拿到的是一套有状态的 API

通过 Gemini API,开发者用 gemini-omni-flash-preview 这个模型名调用,交互对象叫 interaction:上一轮编辑的结果可以用 previous_interaction_id 接住,模型跨轮保持视频状态。这意味着"改视频"可以像"改文档"一样连续进行,适合嵌进生产管线,而不是只做一次性 Demo。

为什么这件事值得企业关注

过去做产品视频、营销短片,要么靠人力剪辑,要么等文生视频模型出片再修。Omni Flash 把门槛和成本往下拉了一截:据谷歌公布,每秒视频输出成本约 0.10 美元,与 Veo 3.1 Fast 持平;官方也坦诚列了局限,比如目前只支持 10 秒、暂不支持音频参考上传、人物一致性仍有瑕疵。换句话说,它现在更适合出草稿,而不是直接交付成片。

对中小企业来说,过去"拍条像样的产品视频"要花钱请人;现在用对话式工具先出草稿、再人工精修,内容生产的单位成本明显降了。

另一层价值在 AI 搜索。多模态内容(带画面的产品介绍、使用演示)能更直观地回答用户问题,而 Gemini 本就是多模态 AI 搜索的主力入口之一。极欧互联 GEO 在帮客户做内容资产时,也越来越重视"图文 + 视频"的组合,而不只是盯文字页。

几个判断

  • 这不是谷歌第一次做视频生成(Veo 更早),但 Omni Flash 的重点是"对话式编辑"和"API 化",方向是嵌入工作流,而非单次出片。
  • 现阶段的 10 秒上限和一致性问题,说明它还替代不了专业制作,更适合做素材草稿、社媒短片和快速原型。
  • 对做 GEO 的团队:视频内容会被 AI 搜索更好地理解和引用,建议把"可检索、带讲解、结构清晰"作为短视频的生产标准。

一句话总结:谷歌把视频生成从"按下按钮出片"推进到"边聊边改",企业内容生产的工具箱又多了一件趁手的。对预算有限的中小商家,真正的机会不在于"用 AI 取代摄影师",而在于把原本做不起的视频内容,用更低成本先跑起来,再靠人工把关质量。对做 GEO 的团队而言,建议现在就开始沉淀可检索、可讲解的短视频素材——等 AI 搜索把视频纳入常规引用,已经积累内容的品牌会先被看见。

信息来源