Vogoo.ai logoVogoo.ai
X (Twitter)
升级
视频
图像
音频
提示词模板
AI 工具
AI 特效
AI 女孩
AI 模型
素材

Flux 3 AI 视频生成器

Flux 3 是 Black Forest Labs 的多模态模型,图像、视频和音频从一开始就联合训练。所以这个 Flux 3 AI 视频生成器可以把一段提示词,或者一张静态图片,直接变成 5 到 20 秒、720p 或 1080p 的 Flux 3 视频,声音也一并生成,全程在同一个 Vogoo 工作台里完成。

Flux 3 视频 · 5–20 秒720p 与 1080p原生音频文生视频与图生视频
生成 Flux 3 视频
Flux 3 AI 视频生成器展示图——由提示词生成的电影感视频画面

什么是 Flux 3 视频模型?

Flux 3 生成视频这件事,涵盖文生视频、图生视频、原生音频和符合物理直觉的运动——一个 Flux 3 模型,顶过去四个工具。

Flux 3 AI 文生视频效果——由一段提示词生成的电影感场景

一段提示词,直接生成 Flux 3 视频

把场景、动作、运镜和氛围写清楚,Flux 3 就能渲染成一条完整片段。Flux 3 视频模型是按视频预测训练出来的,不是从静图模型改造而来,所以一段文字描述会变成连续的运动,而不是一帧帧拼起来的幻灯片。一条提示词,就足以拿到一条能用的 Flux 3 视频。

Flux 3 AI 图生视频效果——静态照片被转成会动的镜头

图生视频:手上任何一张静图都能动起来

上传一张照片、一张产品渲染图或者一张分镜稿,再补一句要发生什么,Flux 3 会让它动起来,同时保住原本的构图、光线和主体。当你已经很清楚首帧该长什么样时,图生视频是进入 Flux 3 视频模型最快的一条路。

Flux 3 AI 原生音频效果——画面与生成音效同步的场景

原生音频,与画面在同一次生成中产出

Flux 3 是图像、视频和音频一起训练出来的,声音和画面来自同一次渲染,而不是事后再配上去。把音频打开,环境声、动作音和空间感就会落在与画面同一条时间线上——不用再开第二个工具,也不用手动对轨。

Flux 3 AI 物理真实的运动表现——重量与接触都可信的动作镜头

有重量、有接触、有因果的画面运动

Flux 3 的训练以视频预测为主,这一点直接体现在物理表现上:物体有重量,手会真的接触到东西,布料和液体会自然沉下来,一个动作能顺理成章地带出下一个。这正是 Flux 3 视频和那些播到一半就漂移、化开的片段之间的实际差距。

Flux 3 AI 多种画幅比例——同一创意分别适配宽屏与竖屏交付

七种画幅,从 21:9 宽银幕到 9:16 竖屏

生成之前先选好 21:9、2:1、16:9、4:3、1:1、3:4 或 9:16,Flux 3 会按这个画幅去构图,而不是把宽画面裁窄。同一个创意可以既出一条宽屏主片,又出一条竖版社交片,不用把概念重新做一遍。

Flux 3 AI 1080p 画质细节——在 Vogoo 工作台里预览的 20 秒片段

5 到 20 秒,720p 或 1080p 可选

片长可以在 5 到 20 秒之间任意设定;试方向时选 720p,要拿去投广告或做主片时选 1080p。一次 Flux 3 渲染大约一到五分钟出结果,所以你可以坐一会儿就对比好几条,再下载留用的那条 MP4。

Flux 3 与 Flux 2 对比:新一代 Flux 多了什么

Flux 3 和 Flux 2 的区别,说到底是输出形态的区别:FLUX.2 负责把画面画出来,Flux 3 负责让画面动起来、还发出对的声音。

Flux 3 与 FLUX.2 在输出形态、训练方式、声音、分辨率、输入和适用场景上的对比
对比项Flux 3FLUX.2
主要输出5–20 秒的视频片段静态图片与图片编辑
训练方式图像、视频、音频从一开始联合训练面向图像生成与编辑
声音同一次渲染直接产出原生音频图像模型不涉及
分辨率720p 或 1080p 视频最高 4MP 的照片级静图
输入方式提示词,或加一张参考静图提示词加多张参考图
适合做什么广告、社交视频、分镜预演、产品动效照片级静图、产品图、修图

Flux 3 不是「更快的 FLUX.2」,两者干的是不同的活:FLUX.2 依然是图像主力,Flux 3 则补上了运动和声音。本页把 Flux 3 当作视频生成器来用。

Flux 3 在 Flux AI 模型家族里的位置

在它之前,每一代 Flux AI 模型输出的都是静图。Flux 3 是这条脉络里第一个加上运动和声音的版本。

FLUX.1——最早的 Flux AI 图像家族

让 Flux AI 一战成名的版本,大家在本地跑的 schnell 和 dev 权重也出自这里。它只做图像,也是大多数 Flux 模型对比的起点。

FLUX.2——当前的图像生成主力

Black Forest Labs 现役的图像模型:最高 4MP 的照片级静图,支持多图参考控制和编辑。大家搜「Flux 图像生成器」的时候,通常说的就是它。

Flux Kontext——基于参考图的图片编辑

上下文编辑这条产品线,用来改一张已有的图,而不是从零画一张。Vogoo 的图像工具里跑的是 Kontext Pro 和 Kontext Max。

Flux 3——迈入视频与音频的多模态一代

最新的 Flux 模型,Black Forest Labs 于 2026 年 7 月 23 日发布,图像、视频、音频联合训练。Flux 3 是 Flux 家族第一个能输出带声音动态画面的版本,本页跑的就是它。

Flux 3 由 Black Forest Labs 打造,也就是 Flux 模型家族背后的那个实验室。

Flux 3 都被拿来做什么:广告、社交与故事内容

Flux 3 适合所有需要快速拿到一段可信短镜头的人——投放、创作者、产品团队、影视从业者、美术和老师。

效果营销与投放

不用实拍就能批量出付费社交广告的素材版本。先写好钩子,渲染一条 1080p 的 Flux 3 视频,再用同一个创意出一条竖版,同一周内就能把两版一起投出去测。

社交与短视频创作者

一张静图——照片、封面图或者一张主视觉——就能变成带声音的 9:16 竖版片段。用 Flux 3 图生视频,你完全不用打开剪辑时间线,也能发动态内容。

电商与产品团队

让产品渲染图动起来:物体旋转、表面反光、落下时有真实的重量感。Flux 3 视频模型在接触和材质表现上足够可信,而这恰恰是大多数产品动效翻车的地方。

影视与分镜预演

在叫团队之前先把镜头搭出来。选 21:9,把运镜写清楚,用生成出来的 Flux 3 片段当会动的故事板,去争取你真正想要的那套拍法。

游戏与概念美术

把一张概念图推成动态,看看这个想法读起来是不是一个动作,而不只是一个姿势。一条 5 秒的 Flux 3 片段成本足够低,可以先试三个方向再定稿。

教育与知识科普

把一个流程、一套机制或者课程里的某个瞬间,做成一小段带环境声的画面,不用再去素材库里翻那些永远差一点意思的空镜。

三步用 Flux 3 生成视频

Flux 3 的流程一直很短:描述或上传素材,设好片长、画幅和声音,然后生成并下载成片。

01
1

步骤 01

描述或上传

在文生视频标签页里写一段提示词;或者切到图生视频,上传你想让 Flux 3 动起来的那张静图。

02
2

步骤 02

设置片长、画幅和声音

选 5 到 20 秒的片长,选 720p 或 1080p,从七种画幅比例里挑一个,再决定原生音频要不要打开。

03
3

步骤 03

生成并下载

点击生成,在预览区里对比几条结果,然后下载 MP4——全程都不用离开 Vogoo 工作台。

Flux 3 常见问题

这里回答 Flux 3 是什么、免不免费、什么时候发布、出图还是出视频、音频怎么来的、各种叫法有什么区别,以及是谁做的。

Flux 3 是 Black Forest Labs 推出的多模态 AI 模型,图像、视频和音频是联合训练的,而不是从图像生成模型改造出来的。在本页里,Flux 3 以视频生成器的形态运行:给它一段提示词或者一张静态图片,它就会渲染出一条 5 到 20 秒、带原生音频、720p 或 1080p 的片段。

搭配 Flux 3 一起用的更多 Vogoo 工具

文生视频图生视频文生图Seedance 2.5Wan 2.7

现在就免费用 Flux 3 开始创作

把一段提示词或一张静图,变成一条自带原生音频的 Flux 3 视频——5 到 20 秒,720p 或 1080p,都在同一个 Vogoo 工作台里完成。

生成 Flux 3 视频查看价格