Vogoo.ai logoVogoo.ai
X (Twitter)
升级
视频
图像
音频
提示词模板
AI 工具
AI 特效
AI 女孩
AI 模型
素材

在线 AI 视频生成

Gemini Omni Flash AI 视频生成器

Gemini Omni Flash 是 Google 全新 Omni 系列的首个模型,一个多模态生成器:文本、图片、音频、视频都能作为输入,直接产出自带原生音频的视频。在 Vogoo 里就能用它做短视频、数字人口播和对话式修改。

多模态输入原生音频最长 10 秒最多 7 张参考图数字人口播
开始生成视频

核心能力

Gemini Omni Flash 的多模态视频能力

文本、图片、音频、视频都能作为输入,直接生成自带原生音频的视频——专为短视频、数字人和对话式修改而生。

Gemini Omni Flash 文生视频关键帧——由提示词生成的场景
01

文生视频与图生视频

描述一个场景,或者直接上传图片,模型就会生成带运动和原生音频的视频。文本、图片、音频、视频四类输入由同一个多模态模型处理,不用在几个工具之间来回倒腾。

Gemini Omni Flash 原生音频关键帧——画面与声音同步的视频场景
02

原生音频,一次生成

声音和画面在同一次生成中一起产出,音画天然同步,不需要再单独配音或走一轮后期。

Gemini Omni Flash 对话式编辑关键帧——多轮对话中逐步打磨的视频
03

对话式编辑

生成之后还能接着聊着改。模型在多轮对话里直接修改已有视频,同时保持场景连贯,每次调整都不会把你已经认可的画面推倒重来。

Gemini Omni Flash 数字人关键帧——会说话的数字人口播视频
04

数字人口播

驱动会说话的数字人,用来做 UGC 素材、广告和讲解视频。角色开口说话、口型对得上声音,正好适合以人脸为主的竖版短视频。

Gemini Omni Flash 物理与运动关键帧——场景中真实自然的运动表现
05

物理与运动更真实

模型对世界的理解,让它更懂物理规律、运动方式和场景连贯性,因此 Gemini Omni Flash 生成的画面动起来更自然,也更经得起细看。

Gemini Omni Flash 参考图关键帧——依靠参考图保持角色一致
06

最多 7 张参考图

一次可以放进最多 7 张参考图,让人物和产品在整条视频里保持一致,适合品牌内容和有剧情的视频。

模型对比

Gemini Omni Flash、Veo 与 Seedance 对比

从输入类型、修改方式、原生音频、数字人和单条时长五个维度,看这三个模型分别强在哪里。

Gemini Omni FlashVeoSeedance 2.x
输入类型图片 · 音频 · 视频 · 文本文本(部分支持图片)文本 · 图片 · 参考素材
修改方式对话式多轮编辑只能重新生成只能重新生成
原生音频支持因版本而异支持
数字人支持能力有限需另配数字人工具
参考图数量最多 7 张—最多 12 张
单条时长最长 10 秒因版本而异4–15 秒

这里只对比能力维度:Google 尚未公布该模型与 Veo 的基准测试结果,所以表格里不放任何性能跑分。

适用场景

Gemini Omni Flash 适合谁用

适合需要快速出多模态短片的创作者和团队:Shorts、数字人 UGC、产品故事、营销素材和分镜预演都能覆盖。

YouTube Shorts 与 Reels

一段提示词或一张图片,就能出一条 Shorts、Reels、TikTok 用的短视频草稿——时长正好适合竖版,出片够快,一天能试很多个想法。

数字人 UGC 与广告

用数字人拍口播型 UGC、产品广告和讲解视频,不用摄像机、不用棚,也不用请出镜的人。

产品故事

把产品静图变成动态画面,用在商品详情、新品发布和社交内容里——原生音频让一次生成就是一段完整的故事。

营销与社交短片

把一句广告语变成带同步音频的视频,再用对话继续调整措辞和节奏,直到表达和卡点都对味。

概念稿与分镜

同一个场景快速出几种不同感觉,团队先看方向、定调子,再决定要不要投入正式制作。

创作者素材

用文本或图片生成片头、空镜和背景动画,直播和视频都能用,而且都自带原生音频。

使用步骤

三步用 Gemini Omni Flash 生成视频

流程很快:描述场景或上传参考图,设置好参数,然后生成并下载自带原生音频的视频。

01
1

步骤 01

描述或上传

在输入框里写一段提示词,或者上传最多 7 张参考图,交给模型让画面动起来。

02
2

步骤 02

设置参数

选好时长(最长 10 秒),让模型在同一次生成里把原生音频一起做出来。

03
3

步骤 03

生成并下载

点击生成,需要的话再用对话继续修改,满意后直接下载 MP4。

用户评价

创作者怎么评价 Gemini Omni Flash

看看创作者、营销人和影视制作者,都是怎么用多模态输入、原生音频、数字人和对话式编辑这几项能力的。

JE

Jordan Ellis

短视频创作者

“Gemini Omni Flash 一次生成就把同步音频给我配好了,我的 Shorts 从写提示词到发布,中间不用再单独做声音。”

NP

Nina Patel

社交媒体运营

“我上传产品静图,它动起来之后品牌元素还是稳的。7 张参考图这个上限,足够让人物形象在一整轮投放里保持一致。”

RC

Rafael Costa

内容营销负责人

“最出乎意料的是对话式编辑,我现在几乎离不开它。多轮改下来场景还是连贯的,不用每次都从头再生成一遍。”

CD

Claire Dubois

UGC 创作者

“有了数字人,我不用摄像机也不用请人出镜,就能交付口播型 UGC 广告,而且每一条声音都对得上口型。”

JE

Jordan Ellis

短视频创作者

“Gemini Omni Flash 一次生成就把同步音频给我配好了,我的 Shorts 从写提示词到发布,中间不用再单独做声音。”

NP

Nina Patel

社交媒体运营

“我上传产品静图,它动起来之后品牌元素还是稳的。7 张参考图这个上限,足够让人物形象在一整轮投放里保持一致。”

RC

Rafael Costa

内容营销负责人

“最出乎意料的是对话式编辑,我现在几乎离不开它。多轮改下来场景还是连贯的,不用每次都从头再生成一遍。”

CD

Claire Dubois

UGC 创作者

“有了数字人,我不用摄像机也不用请人出镜,就能交付口播型 UGC 广告,而且每一条声音都对得上口型。”

JE

Jordan Ellis

短视频创作者

“Gemini Omni Flash 一次生成就把同步音频给我配好了,我的 Shorts 从写提示词到发布,中间不用再单独做声音。”

NP

Nina Patel

社交媒体运营

“我上传产品静图,它动起来之后品牌元素还是稳的。7 张参考图这个上限,足够让人物形象在一整轮投放里保持一致。”

RC

Rafael Costa

内容营销负责人

“最出乎意料的是对话式编辑,我现在几乎离不开它。多轮改下来场景还是连贯的,不用每次都从头再生成一遍。”

CD

Claire Dubois

UGC 创作者

“有了数字人,我不用摄像机也不用请人出镜,就能交付口播型 UGC 广告,而且每一条声音都对得上口型。”

MY

Marcus Yoo

独立影视制作人

“运动和物理表现比我预想的拼接感好太多了。用它做的分镜预演,已经足够拿去给人讲这场戏怎么拍。”

AF

Aiko Fujimoto

产品市场经理

“一句广告文案就能变成带原生音频的视频,再用对话把节奏调到位,等于省掉了一整轮剪辑。”

LM

Lena Muller

动效设计师

“文本和图片能一起喂进同一个模型,这正是我想要的流程。Gemini Omni Flash 会把参考图和提示词当成同一份需求来理解。”

DO

David Okafor

广告公司创意总监

“做社交平台的快速概念稿时,团队几分钟就能给同一个场景出好几个版本,方向定下来再进正式制作。”

MY

Marcus Yoo

独立影视制作人

“运动和物理表现比我预想的拼接感好太多了。用它做的分镜预演,已经足够拿去给人讲这场戏怎么拍。”

AF

Aiko Fujimoto

产品市场经理

“一句广告文案就能变成带原生音频的视频,再用对话把节奏调到位,等于省掉了一整轮剪辑。”

LM

Lena Muller

动效设计师

“文本和图片能一起喂进同一个模型,这正是我想要的流程。Gemini Omni Flash 会把参考图和提示词当成同一份需求来理解。”

DO

David Okafor

广告公司创意总监

“做社交平台的快速概念稿时,团队几分钟就能给同一个场景出好几个版本,方向定下来再进正式制作。”

常见问题

Gemini Omni Flash 常见问题

这里回答 Gemini Omni Flash 是什么、怎么用、原生音频、视频时长、图生视频、水印、API 接入和免费积分等问题。

它是 Google 在 Google I/O 2026 上发布的全新 Omni 系列中的第一个模型。这是一个多模态生成器,可以接收图片、音频、视频和文本输入,生成并修改视频,而且音频是原生一起产出的。

更多 Vogoo 工具,把这条视频做完整

文生视频图生视频AI 数字人AI 角色生成器

现在就在 Vogoo 用 Gemini Omni Flash 开始创作

生成你的第一条 Gemini Omni Flash 视频——描述一个场景或上传参考图,生成带原生音频的成片,然后在同一个工作台里下载。

开始生成视频