
一段提示词,直接生成 Flux 3 视频
把场景、动作、运镜和氛围写清楚,Flux 3 就能渲染成一条完整片段。Flux 3 视频模型是按视频预测训练出来的,不是从静图模型改造而来,所以一段文字描述会变成连续的运动,而不是一帧帧拼起来的幻灯片。一条提示词,就足以拿到一条能用的 Flux 3 视频。
Vogoo.aiFlux 3 是 Black Forest Labs 的多模态模型,图像、视频和音频从一开始就联合训练。所以这个 Flux 3 AI 视频生成器可以把一段提示词,或者一张静态图片,直接变成 5 到 20 秒、720p 或 1080p 的 Flux 3 视频,声音也一并生成,全程在同一个 Vogoo 工作台里完成。

Flux 3 生成视频这件事,涵盖文生视频、图生视频、原生音频和符合物理直觉的运动——一个 Flux 3 模型,顶过去四个工具。

把场景、动作、运镜和氛围写清楚,Flux 3 就能渲染成一条完整片段。Flux 3 视频模型是按视频预测训练出来的,不是从静图模型改造而来,所以一段文字描述会变成连续的运动,而不是一帧帧拼起来的幻灯片。一条提示词,就足以拿到一条能用的 Flux 3 视频。

上传一张照片、一张产品渲染图或者一张分镜稿,再补一句要发生什么,Flux 3 会让它动起来,同时保住原本的构图、光线和主体。当你已经很清楚首帧该长什么样时,图生视频是进入 Flux 3 视频模型最快的一条路。

Flux 3 是图像、视频和音频一起训练出来的,声音和画面来自同一次渲染,而不是事后再配上去。把音频打开,环境声、动作音和空间感就会落在与画面同一条时间线上——不用再开第二个工具,也不用手动对轨。

Flux 3 的训练以视频预测为主,这一点直接体现在物理表现上:物体有重量,手会真的接触到东西,布料和液体会自然沉下来,一个动作能顺理成章地带出下一个。这正是 Flux 3 视频和那些播到一半就漂移、化开的片段之间的实际差距。

生成之前先选好 21:9、2:1、16:9、4:3、1:1、3:4 或 9:16,Flux 3 会按这个画幅去构图,而不是把宽画面裁窄。同一个创意可以既出一条宽屏主片,又出一条竖版社交片,不用把概念重新做一遍。

片长可以在 5 到 20 秒之间任意设定;试方向时选 720p,要拿去投广告或做主片时选 1080p。一次 Flux 3 渲染大约一到五分钟出结果,所以你可以坐一会儿就对比好几条,再下载留用的那条 MP4。
Flux 3 和 Flux 2 的区别,说到底是输出形态的区别:FLUX.2 负责把画面画出来,Flux 3 负责让画面动起来、还发出对的声音。
| 对比项 | Flux 3 | FLUX.2 |
|---|---|---|
| 主要输出 | 5–20 秒的视频片段 | 静态图片与图片编辑 |
| 训练方式 | 图像、视频、音频从一开始联合训练 | 面向图像生成与编辑 |
| 声音 | 同一次渲染直接产出原生音频 | 图像模型不涉及 |
| 分辨率 | 720p 或 1080p 视频 | 最高 4MP 的照片级静图 |
| 输入方式 | 提示词,或加一张参考静图 | 提示词加多张参考图 |
| 适合做什么 | 广告、社交视频、分镜预演、产品动效 | 照片级静图、产品图、修图 |
Flux 3 不是「更快的 FLUX.2」,两者干的是不同的活:FLUX.2 依然是图像主力,Flux 3 则补上了运动和声音。本页把 Flux 3 当作视频生成器来用。
在它之前,每一代 Flux AI 模型输出的都是静图。Flux 3 是这条脉络里第一个加上运动和声音的版本。
让 Flux AI 一战成名的版本,大家在本地跑的 schnell 和 dev 权重也出自这里。它只做图像,也是大多数 Flux 模型对比的起点。
Black Forest Labs 现役的图像模型:最高 4MP 的照片级静图,支持多图参考控制和编辑。大家搜「Flux 图像生成器」的时候,通常说的就是它。
上下文编辑这条产品线,用来改一张已有的图,而不是从零画一张。Vogoo 的图像工具里跑的是 Kontext Pro 和 Kontext Max。
最新的 Flux 模型,Black Forest Labs 于 2026 年 7 月 23 日发布,图像、视频、音频联合训练。Flux 3 是 Flux 家族第一个能输出带声音动态画面的版本,本页跑的就是它。
Flux 3 由 Black Forest Labs 打造,也就是 Flux 模型家族背后的那个实验室。
Flux 3 适合所有需要快速拿到一段可信短镜头的人——投放、创作者、产品团队、影视从业者、美术和老师。
不用实拍就能批量出付费社交广告的素材版本。先写好钩子,渲染一条 1080p 的 Flux 3 视频,再用同一个创意出一条竖版,同一周内就能把两版一起投出去测。
一张静图——照片、封面图或者一张主视觉——就能变成带声音的 9:16 竖版片段。用 Flux 3 图生视频,你完全不用打开剪辑时间线,也能发动态内容。
让产品渲染图动起来:物体旋转、表面反光、落下时有真实的重量感。Flux 3 视频模型在接触和材质表现上足够可信,而这恰恰是大多数产品动效翻车的地方。
在叫团队之前先把镜头搭出来。选 21:9,把运镜写清楚,用生成出来的 Flux 3 片段当会动的故事板,去争取你真正想要的那套拍法。
把一张概念图推成动态,看看这个想法读起来是不是一个动作,而不只是一个姿势。一条 5 秒的 Flux 3 片段成本足够低,可以先试三个方向再定稿。
把一个流程、一套机制或者课程里的某个瞬间,做成一小段带环境声的画面,不用再去素材库里翻那些永远差一点意思的空镜。
Flux 3 的流程一直很短:描述或上传素材,设好片长、画幅和声音,然后生成并下载成片。
步骤 01
在文生视频标签页里写一段提示词;或者切到图生视频,上传你想让 Flux 3 动起来的那张静图。
步骤 02
选 5 到 20 秒的片长,选 720p 或 1080p,从七种画幅比例里挑一个,再决定原生音频要不要打开。
步骤 03
点击生成,在预览区里对比几条结果,然后下载 MP4——全程都不用离开 Vogoo 工作台。
这里回答 Flux 3 是什么、免不免费、什么时候发布、出图还是出视频、音频怎么来的、各种叫法有什么区别,以及是谁做的。
Flux 3 是 Black Forest Labs 推出的多模态 AI 模型,图像、视频和音频是联合训练的,而不是从图像生成模型改造出来的。在本页里,Flux 3 以视频生成器的形态运行:给它一段提示词或者一张静态图片,它就会渲染出一条 5 到 20 秒、带原生音频、720p 或 1080p 的片段。
把一段提示词或一张静图,变成一条自带原生音频的 Flux 3 视频——5 到 20 秒,720p 或 1080p,都在同一个 Vogoo 工作台里完成。