
音频生成视频:Seedance 2.5 的纯音频参考模式
Seedance 2.5 首次支持只参考音频:上传一段 BGM、人声或音效即可驱动画面节奏、卡点剪辑与口型对齐。本文梳理官方音频规格(mp3/wav、15MB、2~30 秒、最多 10 段)与 7 种模态组合,并附 5 个官方案例的原版中文提示词与可复用工作流。
几乎所有 AI 视频工作流都卡在同一步:先生成一段没有声音的画面,然后在剪辑软件里熬上一个小时,把切点一帧帧对到鼓点上,再想办法让嘴型对上台词。Seedance 2.5 换了个方向解题——它允许你先把一段音频交给模型,作为参考素材输入,让画面跟着声音长出来。这就是新增的只参考音频模式:投喂一段 BGM、一句人声或一条音效,模型从第一帧起就用它来驱动节奏、卡点和口型对齐。这是 Seedance 系列头一回支持这种玩法,而截至本文写作时,全网几乎找不到像样的教程。
本文基于字节跳动官方发布的《Seedance 2.5 企业实践手册》,并在 Vogoo studio 里实际跑过一遍做交叉验证。下文所有规格、限制和提示词都能追溯到官方文档或文末列出的来源,没有一处是猜的。
什么是只参考音频
字节把 Seedance 2.5 定义为音画联合生成模型:声音和画面是一起生成的,而不是后期拼上去的。它的参考体系接受三类模态——图片、视频、音频,而 2.5 是第一个允许音频单独作为唯一参考的版本。
官方实践手册明确列出了 7 种模态组合:
| # | 组合方式 | 2.5 中的状态 |
|---|---|---|
| 1 | 只参考图片 | 沿用 |
| 2 | 只参考视频 | 沿用 |
| 3 | 只参考音频 | 2.5 新增 |
| 4 | 图片 + 视频 | 沿用 |
| 5 | 音频 + 视频 | 沿用 |
| 6 | 图片 + 音频 | 沿用 |
| 7 | 图片 + 音频 + 视频 | 沿用 |
按手册说法,参考音频可以是一段 BGM、一句人声或一条音效——模型会从中读出节奏、情绪和语音信息,再据此构建画面:切点落在鼓点上,角色嘴型对上台词,场景能量跟着音轨的强弱起伏走。
音频这一项升级,装在 2.0 到 2.5 一整轮参考能力扩容里:
| 规格 | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| 单段直出时长 | 15s | 30s |
| 参考图片 | 9 张 | 30 张 |
| 参考视频 | 3 段 | 10 段 |
| 参考音频 | 3 段 | 10 段 |
| 参考素材总时长 | 15s | 30s(视频与音频分开计算) |
| 音频单独作参考 | 不支持 | 支持 |
| 原生语种 | — | 11 种(中文、英语、西班牙语、日语、韩语、阿拉伯语等) |
如果你想看音频之外的全部变化,Seedance 2.5 专题页覆盖了整轮发布;本文只聚焦音频这条链路。
音频参考规格:到底能传什么
在动手写提示词之前,先把硬限制记住。以下数字直接来自官方实践手册:
| 限制项 | 数值 |
|---|---|
| 音频数量 | 每次生成 0~10 个 |
| 单个文件大小 | 不超过 15MB |
| 支持格式 | mp3、wav |
| 单段时长 | 2~30 秒 |
| 音频总时长 | 全部音频加起来 ≤ 30 秒 |
| 与视频参考的关系 | 视频时长与音频时长分开计算——同一个任务里可以既传 30s 视频参考,又传 30s 音频参考 |
两个实操提醒。第一,别走极端:贴着 2 秒下限的片段信息量不足、特征不完整,模型很难稳定识别;而把 30 秒上限填满又容易让关键特征被稀释、噪声变多。与其上传整首歌,不如剪出你真正在意的那一小段。第二,@ 符号的纪律对音频同样成立:每引用一个素材,就要紧跟一句使用声明——"音效参考 @音频1"——绝不能出现"参考 @音频1"这种无头无尾、没交代用途的写法。
五个官方案例:从纯音频到全模态
实践手册按复杂度阶梯演示了整条音频链路。以下是 5 个官方案例,凡是手册给出提示词原文的地方,都原样附上。
案例 1 —— 只参考音频:两只守宫的越狱会议
这是新模式的旗舰演示。唯一的参考素材是两段音频——一段马戏团后台环境底噪,一段背景音乐。没有图片,没有视频。模型据此搭出一段 3D 动画,调度和情绪节点全跟着声音走。
Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。
官方提示词的开头是这样的:
【两只守宫的越狱会议 — 3D 动画 | 马戏团后台 | 约 20 秒】
【一句话梗概】 开场先留一段环境空镜交代"这是马戏团后台",随后两只守宫(一只
胖胖的、一只小小的)商量逃出马戏团的策略,爆发简短争执,最后达成一致;以放大
的马戏团后台环境音底噪为主,背景音乐几乎全程铺底、在关键情绪点加强。注意这段提示词做了什么:它给每一层音频都分派了明确职责(环境底噪打底,音乐负责情绪加强)。这就是值得抄走的写法。
案例 2 —— 节奏迁移:换耳机广告
这个案例把一张产品图和一段参考视频配在一起,目标是迁移剪辑节奏——原片的切点和转场速度被搬到一条全新的产品短片上。这跟音频模式调动的是同一块"卡点肌肉",只不过控制权在视频这一侧:
Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。
参考 @视频1 的运镜方式与剪辑节奏,生成一条耳机@图片的广告短片。适配符合产品
调性的场景,强调现代、简洁、科技感。产品特写与场景全景的切换点与原片一致,保
持同样的运动速度与转场方式。案例 3 —— 三模态齐上:26 秒走路长镜头
最完整的工作流:一摞参考图片(人物、服装、场景)、多段参考视频(镜头语言)、外加音效素材,全塞进一条 26 秒一镜到底里,镜头内还要完成昼夜交替与四季流转。官方提示词的开头部分:
Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。
核心指令: 全程 26 秒一镜到底(One-Shot)叙事短片,稳定跟拍,参考【视频1】与
平滑环绕运镜,参考【视频2】交织。平滑行进感。镜头内实现昼夜交替与四季流转。
主角是一位欧洲女人【图片1】,置身充满烟火气的人海,凸显极致的孤独感与电影摄影
质感。
分段运镜与场景描述:
0-3 秒(平稳背跟): 老旧木门【图片2】"吱呀"推开,镜头紧随欧洲女人穿着
【图片3】的背影步出。他在门槛处微停,前方街巷光影斑驳,叫卖与人潮声扑面而
来。她神情疏离,缓缓迈步融入街道。每一份素材都被点名、被派活,而且是按时间轴分段派的。
案例 4 —— 音乐驱动多角色:宫廷舞会
一条 41 秒的宫殿宴会群像镜头,一大票角色在整个镜头里保持一致,其中一段参考音频负责控制某个角色说台词时的音色:
Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。
官方提示词里的关键一句:
男1从画面左前方伸出右手,用右手拿起一只香槟杯,举到右肩前方,面向前方宾客大
声说:"Everyone, enjoy this party!"(音色参考 @音频1)那个括号就是整套口型对齐工作流的全部:把台词写死在提示词里,把音色指向一段参考音频,模型负责演出来——包括嘴型。
案例 5 —— 音乐配 3D 白模:飞船
手册里最硬的一道参考题:把一段专业级 3D 白模(无材质预演)动画当作 @视频1 输入,一张风格图当作 @图片1,让模型把整段序列重渲染到成片质感,同时逐帧保住结构和运镜。官方演示片配了音乐,展示预演如何变成一段带配乐的成片:
Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。
保持 @视频1 中的镜头运动、时长、构图、景别、空间关系、物体位置、模型结构和运
动轨迹不变,以 @图片1 作为材质、光照、色彩和整体氛围参考,将 @视频1 中的白膜
材质替换为接近 @图片1 的真实材质,加入自然光影、接触阴影、环境光、反射、高光
和空间层次,整体呈现真实电影级渲染质感。同样这套参考组合——音频、图片、视频一起上——可以在 Vogoo 的 Seedance 2.5 studio 里免费试,它支持模型完整的 30 秒一镜到底生成、最高 4K 输出、原生同步音频,以及单次任务最多 50 个参考素材。
自己写音频 + 图片 / 视频提示词
把官方案例提炼一下,可复用的流程是这样:
- 先把音频剪到真正要用的那一段。 mp3 或 wav,小于 15MB,单段控制在 2~30 秒——一小段精准的素材胜过整首曲子。
- 上传后给每段音频明确派活。 氛围驱动型生成的标准写法是:
音乐氛围参考 @音频1,画面主体参考 @图片1,生成一条节奏契合的短片。一份素材,一句声明,永远成对出现。 - 多段音频要分层。 环境底噪、音乐、人声、点缀音效各占一段、各有各的职责说明——就像守宫那个案例一样。
- 台词写进提示词,音色指向音频。 把确切台词用引号写出来,后面跟上
(音色参考 @音频N)——舞会案例的写法。 - 要给已有视频换声音,走编辑范式:
保持 @视频1 的画面与运镜不变,将背景音乐替换为 @音频1。这属于视频转视频操作,而不是重新生成一条。
如果你对 @ 参考语法本身还不熟,参考生视频工作流用的是同一套语法,三种模态通用。
它到底差在哪
大多数 AI 视频工具把声音当成事后补的东西——你先用文字或图片提示词生成无声画面,再在剪辑软件里硬贴上音轨,祈祷切点大致对得上。少数模型能自己生成配乐,但你没法把自己那条音轨交给它、让画面听它的。Seedance 2.5 的只参考音频把这条流水线倒了过来:音频成了一等输入,在生成阶段就决定节奏、切点、情绪和嘴型。开源阵营的对手 MiniMax H3 这一轮猛攻的是运动质量,但把参考音频当成可独立驱动的输入,仍是字节自己主张的差异点——而且按企业手册的说法,2.5 的 10 段、30 秒音频额度是与视频参考额度分开计算的,两种模态谁也不挤谁。
音频驱动适合用在哪
有三类工作流会被明显压缩:
- 音乐视频卡点。 手册里的卡点案例可以看到造型和场景切换准确落在配乐节拍上——音乐让它在哪切它就在哪切。这也是任何 AI 音乐视频生成流程的核心动作:先定曲子,再让画面追着走。
- 口播与配音内容。 写死台词 + 音色参考,等于在生成阶段就拿到了音频驱动的 AI 口型同步;再加上 2.5 原生支持 11 种语言,同一个场景可以按市场换语言演一遍,嘴型跟着每种语言走。
- 氛围片与空镜段落。 守宫案例说明,光靠一层声音底噪就能把场景交代清楚——对品牌情绪片、游戏氛围片、以及"配乐先于素材"的片头段落都很实用。
常见问题
Seedance 2.5 的参考音频支持哪些格式?
mp3 和 wav,单个文件不超过 15MB。单段时长必须在 2~30 秒之间,最多可挂 10 段,且全部音频总时长每次生成上限为 30 秒。
只有一首歌或一段音频,能生成视频吗?
可以——这正是 2.5 新增的只参考音频模式。你上传一段或多段音频,不带图片和视频,再用文字描述场景,模型就会生成节奏、切点和情绪跟着声音走的画面。此前的 Seedance 版本至少需要一张图片或一段视频作为参考。
音频参考能做口型同步吗?
能。把确切台词写进提示词,再挂一段人声素材并声明"音色参考 @音频1"——官方的舞会演示就是这么让角色把台词说出来、嘴型还对得上的。模型在支持的 11 种语言上都会做口型对齐。
传了音频参考,能引用的视频会变少吗?
不会。官方手册写明视频时长与音频时长分开计算——同一个任务里可以并存 30 秒视频参考和 30 秒音频参考,整体仍在 50 个素材的上限内(30 张图 + 10 段视频 + 10 段音频)。
音频生成视频跟在剪辑软件里配乐有什么区别?
剪辑是在画面定稿之后才加声音,所以你得反过来重剪素材去迁就音轨。音频驱动生成把音轨变成输入:鼓点、能量变化和台词在画面被造出来的那一刻就参与塑形,切点和嘴型天生就是对的,不需要手动对轨。
在哪里可以试 Seedance 2.5 的音频能力?
Vogoo 上的 Seedance 2.5 studio 直接在浏览器里跑这个模型——30 秒一镜到底生成、最高 4K、原生同步音频、单次任务最多 50 个参考素材,并且可以免费开始。套餐细节见价格页。
写在最后
只参考音频是 Seedance 2.5 里最容易被忽略的头条:在这条模型线上第一次,一段音乐、一句人声或一条音效可以成为驱动整次生成的东西,画面按声音长出来,而不是反过来。规格也给得大方——10 段素材、30 秒音频额度与视频参考分开计算——而官方案例展示了同一套 @ 语法从两段音频的守宫短片,一路撑到带音色台词的多角色舞会长镜头。如果你的工作本来就从声音开始——一个节拍、一段台词、一条配乐——这一步能把过去吃掉你半个下午的对轨环节直接抹掉。剪一段音频,声明它的职责,然后到 Vogoo 的 Seedance 2.5 studio 里跑一次,一遍就能同时听到和看到结果。
来源
- Doubao-Seedance-2.5 企业实践手册 —— 字节跳动 / 火山引擎(飞书文档) —— 主要来源:全部音频规格(15MB、mp3/wav、2~30s 单段、10 段 / 30s 上限、时长分开计算)、7 种模态组合,以及上文引用的全部官方案例提示词。
- Seedance 2.5 —— 一镜直出、灵活参考 · 字节跳动 Seed 博客 —— 官方发布公告,确认 30 张图片 + 10 段视频 + 10 段音频的参考额度,以及 30 秒音画一次生成。
- Seedance 2.5 官方产品页 —— 字节跳动 Seed —— 将 2.5 定位为音画联合生成模型;确认 30s 单次生成、白模控制与基于参考的编辑能力。
- 字节跳动发布 Seedance 2.5 视频生成模型 —— TechNode —— 2026 年 7 月 31 日在即梦 AI 与豆包 Pro 上线,API 计划通过火山引擎方舟开放。
- 字节跳动发布 Seedance 2.5:支持 50 个参考输入的 30 秒原生 4K AI 视频模型 —— TNW —— 对 50 个参考素材上限与原生 4K 输出的独立佐证。
- 字节跳动发布 Seedance 2.5 视频模型 —— The Information —— 行业媒体对本次发布的简报。
- 字节跳动 Seedance 2.5:原生 30 秒 AI 视频,无需拼接 —— Tech Times —— 2026 年 6 月 23 日火山引擎 FORCE 大会首次亮相;单段连续 30 秒、无需拼接。
- 中国 AI 视频之争选边站队:Seedance 2.5 闭源、MiniMax H3 开源 —— Tech Times —— Seedance 2.5 与 MiniMax H3 对比的竞争背景。
- 报道称字节跳动暂停 Seedance 2.0 视频生成器的全球发布 —— TechCrunch —— 本次发布所取代的 2.0 一代的背景资料。
- Seedance 2.0 音频输入指南 —— 火山引擎 —— 关于如何挑选干净参考音频的官方指引,也是 2.5 只参考音频模式的能力源头。
作者

分类
更多文章

Seedance 2.5 Prompt 指南:官方 @ 引用语法完全拆解
本文系统拆解 Seedance 2.5 官方 @ 引用语法:@图片N / @视频N / @音频N 的使用声明写法、7 种模态组合、50 个参考素材(30 张图 + 10 段视频 + 10 段音频)的规格与配比原则,并附字节跳动实践手册的 5 个原版案例 Prompt,含 32 个参考素材的武侠群像。


Seedance 2.5 视频续写延长完全指南
用 Seedance 2.5 延长 AI 视频的完整方法:把已有片段作为 @视频1 喂回模型做原生时序延长,逐条拆解字节官方四段链式续写案例的中文 prompt 原文,讲清续写公式、自动锁定的画幅与时长规则、首尾帧画幅坑,以及什么时候 30 秒一镜到底比续写更划算。


Seedance 2.5 对比 2.0:每一项升级都拆开看
Seedance 2.5 与 2.0 逐项对比:30 秒一镜直出、50 个参考素材、纯音频驱动、专业级局部编辑,附官方演示实拍与「该不该现在换」的决策框架。

邮件列表
加入我们的社区
订阅邮件列表,及时获取最新消息和更新