
文生视频与图生视频
描述一个场景,或者直接上传图片,模型就会生成带运动和原生音频的视频。文本、图片、音频、视频四类输入由同一个多模态模型处理,不用在几个工具之间来回倒腾。
Vogoo.ai在线 AI 视频生成
Gemini Omni Flash 是 Google 全新 Omni 系列的首个模型,一个多模态生成器:文本、图片、音频、视频都能作为输入,直接产出自带原生音频的视频。在 Vogoo 里就能用它做短视频、数字人口播和对话式修改。
核心能力
文本、图片、音频、视频都能作为输入,直接生成自带原生音频的视频——专为短视频、数字人和对话式修改而生。

描述一个场景,或者直接上传图片,模型就会生成带运动和原生音频的视频。文本、图片、音频、视频四类输入由同一个多模态模型处理,不用在几个工具之间来回倒腾。

声音和画面在同一次生成中一起产出,音画天然同步,不需要再单独配音或走一轮后期。

生成之后还能接着聊着改。模型在多轮对话里直接修改已有视频,同时保持场景连贯,每次调整都不会把你已经认可的画面推倒重来。

驱动会说话的数字人,用来做 UGC 素材、广告和讲解视频。角色开口说话、口型对得上声音,正好适合以人脸为主的竖版短视频。

模型对世界的理解,让它更懂物理规律、运动方式和场景连贯性,因此 Gemini Omni Flash 生成的画面动起来更自然,也更经得起细看。

一次可以放进最多 7 张参考图,让人物和产品在整条视频里保持一致,适合品牌内容和有剧情的视频。
模型对比
从输入类型、修改方式、原生音频、数字人和单条时长五个维度,看这三个模型分别强在哪里。
| Gemini Omni Flash | Veo | Seedance 2.x | |
|---|---|---|---|
| 输入类型 | 图片 · 音频 · 视频 · 文本 | 文本(部分支持图片) | 文本 · 图片 · 参考素材 |
| 修改方式 | 对话式多轮编辑 | 只能重新生成 | 只能重新生成 |
| 原生音频 | 支持 | 因版本而异 | 支持 |
| 数字人 | 支持 | 能力有限 | 需另配数字人工具 |
| 参考图数量 | 最多 7 张 | — | 最多 12 张 |
| 单条时长 | 最长 10 秒 | 因版本而异 | 4–15 秒 |
这里只对比能力维度:Google 尚未公布该模型与 Veo 的基准测试结果,所以表格里不放任何性能跑分。
适用场景
适合需要快速出多模态短片的创作者和团队:Shorts、数字人 UGC、产品故事、营销素材和分镜预演都能覆盖。
一段提示词或一张图片,就能出一条 Shorts、Reels、TikTok 用的短视频草稿——时长正好适合竖版,出片够快,一天能试很多个想法。
用数字人拍口播型 UGC、产品广告和讲解视频,不用摄像机、不用棚,也不用请出镜的人。
把产品静图变成动态画面,用在商品详情、新品发布和社交内容里——原生音频让一次生成就是一段完整的故事。
把一句广告语变成带同步音频的视频,再用对话继续调整措辞和节奏,直到表达和卡点都对味。
同一个场景快速出几种不同感觉,团队先看方向、定调子,再决定要不要投入正式制作。
用文本或图片生成片头、空镜和背景动画,直播和视频都能用,而且都自带原生音频。
使用步骤
流程很快:描述场景或上传参考图,设置好参数,然后生成并下载自带原生音频的视频。
步骤 01
在输入框里写一段提示词,或者上传最多 7 张参考图,交给模型让画面动起来。
步骤 02
选好时长(最长 10 秒),让模型在同一次生成里把原生音频一起做出来。
步骤 03
点击生成,需要的话再用对话继续修改,满意后直接下载 MP4。
用户评价
看看创作者、营销人和影视制作者,都是怎么用多模态输入、原生音频、数字人和对话式编辑这几项能力的。
短视频创作者
“Gemini Omni Flash 一次生成就把同步音频给我配好了,我的 Shorts 从写提示词到发布,中间不用再单独做声音。”
社交媒体运营
“我上传产品静图,它动起来之后品牌元素还是稳的。7 张参考图这个上限,足够让人物形象在一整轮投放里保持一致。”
内容营销负责人
“最出乎意料的是对话式编辑,我现在几乎离不开它。多轮改下来场景还是连贯的,不用每次都从头再生成一遍。”
UGC 创作者
“有了数字人,我不用摄像机也不用请人出镜,就能交付口播型 UGC 广告,而且每一条声音都对得上口型。”
常见问题
这里回答 Gemini Omni Flash 是什么、怎么用、原生音频、视频时长、图生视频、水印、API 接入和免费积分等问题。
它是 Google 在 Google I/O 2026 上发布的全新 Omni 系列中的第一个模型。这是一个多模态生成器,可以接收图片、音频、视频和文本输入,生成并修改视频,而且音频是原生一起产出的。
生成你的第一条 Gemini Omni Flash 视频——描述一个场景或上传参考图,生成带原生音频的成片,然后在同一个工作台里下载。
开始生成视频