Vogoo.ai logoVogoo.ai
  • 提示词模板
  • 博客
  • 价格
Vogoo.ai
音频生成视频:Seedance 2.5 的纯音频参考模式
2026/08/06

音频生成视频:Seedance 2.5 的纯音频参考模式

Seedance 2.5 首次支持只参考音频:上传一段 BGM、人声或音效即可驱动画面节奏、卡点剪辑与口型对齐。本文梳理官方音频规格(mp3/wav、15MB、2~30 秒、最多 10 段)与 7 种模态组合,并附 5 个官方案例的原版中文提示词与可复用工作流。

几乎所有 AI 视频工作流都卡在同一步:先生成一段没有声音的画面,然后在剪辑软件里熬上一个小时,把切点一帧帧对到鼓点上,再想办法让嘴型对上台词。Seedance 2.5 换了个方向解题——它允许你先把一段音频交给模型,作为参考素材输入,让画面跟着声音长出来。这就是新增的只参考音频模式:投喂一段 BGM、一句人声或一条音效,模型从第一帧起就用它来驱动节奏、卡点和口型对齐。这是 Seedance 系列头一回支持这种玩法,而截至本文写作时,全网几乎找不到像样的教程。

本文基于字节跳动官方发布的《Seedance 2.5 企业实践手册》,并在 Vogoo studio 里实际跑过一遍做交叉验证。下文所有规格、限制和提示词都能追溯到官方文档或文末列出的来源,没有一处是猜的。

什么是只参考音频

字节把 Seedance 2.5 定义为音画联合生成模型:声音和画面是一起生成的,而不是后期拼上去的。它的参考体系接受三类模态——图片、视频、音频,而 2.5 是第一个允许音频单独作为唯一参考的版本。

官方实践手册明确列出了 7 种模态组合:

#组合方式2.5 中的状态
1只参考图片沿用
2只参考视频沿用
3只参考音频2.5 新增
4图片 + 视频沿用
5音频 + 视频沿用
6图片 + 音频沿用
7图片 + 音频 + 视频沿用

按手册说法,参考音频可以是一段 BGM、一句人声或一条音效——模型会从中读出节奏、情绪和语音信息,再据此构建画面:切点落在鼓点上,角色嘴型对上台词,场景能量跟着音轨的强弱起伏走。

音频这一项升级,装在 2.0 到 2.5 一整轮参考能力扩容里:

规格Seedance 2.0Seedance 2.5
单段直出时长15s30s
参考图片9 张30 张
参考视频3 段10 段
参考音频3 段10 段
参考素材总时长15s30s(视频与音频分开计算)
音频单独作参考不支持支持
原生语种—11 种(中文、英语、西班牙语、日语、韩语、阿拉伯语等)

如果你想看音频之外的全部变化,Seedance 2.5 专题页覆盖了整轮发布;本文只聚焦音频这条链路。

音频参考规格:到底能传什么

在动手写提示词之前,先把硬限制记住。以下数字直接来自官方实践手册:

限制项数值
音频数量每次生成 0~10 个
单个文件大小不超过 15MB
支持格式mp3、wav
单段时长2~30 秒
音频总时长全部音频加起来 ≤ 30 秒
与视频参考的关系视频时长与音频时长分开计算——同一个任务里可以既传 30s 视频参考,又传 30s 音频参考

两个实操提醒。第一,别走极端:贴着 2 秒下限的片段信息量不足、特征不完整,模型很难稳定识别;而把 30 秒上限填满又容易让关键特征被稀释、噪声变多。与其上传整首歌,不如剪出你真正在意的那一小段。第二,@ 符号的纪律对音频同样成立:每引用一个素材,就要紧跟一句使用声明——"音效参考 @音频1"——绝不能出现"参考 @音频1"这种无头无尾、没交代用途的写法。

五个官方案例:从纯音频到全模态

实践手册按复杂度阶梯演示了整条音频链路。以下是 5 个官方案例,凡是手册给出提示词原文的地方,都原样附上。

案例 1 —— 只参考音频:两只守宫的越狱会议

这是新模式的旗舰演示。唯一的参考素材是两段音频——一段马戏团后台环境底噪,一段背景音乐。没有图片,没有视频。模型据此搭出一段 3D 动画,调度和情绪节点全跟着声音走。

Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。

官方提示词的开头是这样的:

【两只守宫的越狱会议 — 3D 动画 | 马戏团后台 | 约 20 秒】

【一句话梗概】 开场先留一段环境空镜交代"这是马戏团后台",随后两只守宫(一只
胖胖的、一只小小的)商量逃出马戏团的策略,爆发简短争执,最后达成一致;以放大
的马戏团后台环境音底噪为主,背景音乐几乎全程铺底、在关键情绪点加强。

注意这段提示词做了什么:它给每一层音频都分派了明确职责(环境底噪打底,音乐负责情绪加强)。这就是值得抄走的写法。

案例 2 —— 节奏迁移:换耳机广告

这个案例把一张产品图和一段参考视频配在一起,目标是迁移剪辑节奏——原片的切点和转场速度被搬到一条全新的产品短片上。这跟音频模式调动的是同一块"卡点肌肉",只不过控制权在视频这一侧:

Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。

参考 @视频1 的运镜方式与剪辑节奏,生成一条耳机@图片的广告短片。适配符合产品
调性的场景,强调现代、简洁、科技感。产品特写与场景全景的切换点与原片一致,保
持同样的运动速度与转场方式。

案例 3 —— 三模态齐上:26 秒走路长镜头

最完整的工作流:一摞参考图片(人物、服装、场景)、多段参考视频(镜头语言)、外加音效素材,全塞进一条 26 秒一镜到底里,镜头内还要完成昼夜交替与四季流转。官方提示词的开头部分:

Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。

核心指令: 全程 26 秒一镜到底(One-Shot)叙事短片,稳定跟拍,参考【视频1】与
平滑环绕运镜,参考【视频2】交织。平滑行进感。镜头内实现昼夜交替与四季流转。
主角是一位欧洲女人【图片1】,置身充满烟火气的人海,凸显极致的孤独感与电影摄影
质感。

分段运镜与场景描述:

0-3 秒(平稳背跟): 老旧木门【图片2】"吱呀"推开,镜头紧随欧洲女人穿着
【图片3】的背影步出。他在门槛处微停,前方街巷光影斑驳,叫卖与人潮声扑面而
来。她神情疏离,缓缓迈步融入街道。

每一份素材都被点名、被派活,而且是按时间轴分段派的。

案例 4 —— 音乐驱动多角色:宫廷舞会

一条 41 秒的宫殿宴会群像镜头,一大票角色在整个镜头里保持一致,其中一段参考音频负责控制某个角色说台词时的音色:

Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。

官方提示词里的关键一句:

男1从画面左前方伸出右手,用右手拿起一只香槟杯,举到右肩前方,面向前方宾客大
声说:"Everyone, enjoy this party!"(音色参考 @音频1)

那个括号就是整套口型对齐工作流的全部:把台词写死在提示词里,把音色指向一段参考音频,模型负责演出来——包括嘴型。

案例 5 —— 音乐配 3D 白模:飞船

手册里最硬的一道参考题:把一段专业级 3D 白模(无材质预演)动画当作 @视频1 输入,一张风格图当作 @图片1,让模型把整段序列重渲染到成片质感,同时逐帧保住结构和运镜。官方演示片配了音乐,展示预演如何变成一段带配乐的成片:

Seedance 2.5 官方演示 —— 字节跳动 / 火山引擎实践手册。

保持 @视频1 中的镜头运动、时长、构图、景别、空间关系、物体位置、模型结构和运
动轨迹不变,以 @图片1 作为材质、光照、色彩和整体氛围参考,将 @视频1 中的白膜
材质替换为接近 @图片1 的真实材质,加入自然光影、接触阴影、环境光、反射、高光
和空间层次,整体呈现真实电影级渲染质感。

同样这套参考组合——音频、图片、视频一起上——可以在 Vogoo 的 Seedance 2.5 studio 里免费试,它支持模型完整的 30 秒一镜到底生成、最高 4K 输出、原生同步音频,以及单次任务最多 50 个参考素材。

自己写音频 + 图片 / 视频提示词

把官方案例提炼一下,可复用的流程是这样:

  1. 先把音频剪到真正要用的那一段。 mp3 或 wav,小于 15MB,单段控制在 2~30 秒——一小段精准的素材胜过整首曲子。
  2. 上传后给每段音频明确派活。 氛围驱动型生成的标准写法是:音乐氛围参考 @音频1,画面主体参考 @图片1,生成一条节奏契合的短片。一份素材,一句声明,永远成对出现。
  3. 多段音频要分层。 环境底噪、音乐、人声、点缀音效各占一段、各有各的职责说明——就像守宫那个案例一样。
  4. 台词写进提示词,音色指向音频。 把确切台词用引号写出来,后面跟上 (音色参考 @音频N)——舞会案例的写法。
  5. 要给已有视频换声音,走编辑范式:保持 @视频1 的画面与运镜不变,将背景音乐替换为 @音频1。这属于视频转视频操作,而不是重新生成一条。

如果你对 @ 参考语法本身还不熟,参考生视频工作流用的是同一套语法,三种模态通用。

它到底差在哪

大多数 AI 视频工具把声音当成事后补的东西——你先用文字或图片提示词生成无声画面,再在剪辑软件里硬贴上音轨,祈祷切点大致对得上。少数模型能自己生成配乐,但你没法把自己那条音轨交给它、让画面听它的。Seedance 2.5 的只参考音频把这条流水线倒了过来:音频成了一等输入,在生成阶段就决定节奏、切点、情绪和嘴型。开源阵营的对手 MiniMax H3 这一轮猛攻的是运动质量,但把参考音频当成可独立驱动的输入,仍是字节自己主张的差异点——而且按企业手册的说法,2.5 的 10 段、30 秒音频额度是与视频参考额度分开计算的,两种模态谁也不挤谁。

音频驱动适合用在哪

有三类工作流会被明显压缩:

  • 音乐视频卡点。 手册里的卡点案例可以看到造型和场景切换准确落在配乐节拍上——音乐让它在哪切它就在哪切。这也是任何 AI 音乐视频生成流程的核心动作:先定曲子,再让画面追着走。
  • 口播与配音内容。 写死台词 + 音色参考,等于在生成阶段就拿到了音频驱动的 AI 口型同步;再加上 2.5 原生支持 11 种语言,同一个场景可以按市场换语言演一遍,嘴型跟着每种语言走。
  • 氛围片与空镜段落。 守宫案例说明,光靠一层声音底噪就能把场景交代清楚——对品牌情绪片、游戏氛围片、以及"配乐先于素材"的片头段落都很实用。

常见问题

Seedance 2.5 的参考音频支持哪些格式?

mp3 和 wav,单个文件不超过 15MB。单段时长必须在 2~30 秒之间,最多可挂 10 段,且全部音频总时长每次生成上限为 30 秒。

只有一首歌或一段音频,能生成视频吗?

可以——这正是 2.5 新增的只参考音频模式。你上传一段或多段音频,不带图片和视频,再用文字描述场景,模型就会生成节奏、切点和情绪跟着声音走的画面。此前的 Seedance 版本至少需要一张图片或一段视频作为参考。

音频参考能做口型同步吗?

能。把确切台词写进提示词,再挂一段人声素材并声明"音色参考 @音频1"——官方的舞会演示就是这么让角色把台词说出来、嘴型还对得上的。模型在支持的 11 种语言上都会做口型对齐。

传了音频参考,能引用的视频会变少吗?

不会。官方手册写明视频时长与音频时长分开计算——同一个任务里可以并存 30 秒视频参考和 30 秒音频参考,整体仍在 50 个素材的上限内(30 张图 + 10 段视频 + 10 段音频)。

音频生成视频跟在剪辑软件里配乐有什么区别?

剪辑是在画面定稿之后才加声音,所以你得反过来重剪素材去迁就音轨。音频驱动生成把音轨变成输入:鼓点、能量变化和台词在画面被造出来的那一刻就参与塑形,切点和嘴型天生就是对的,不需要手动对轨。

在哪里可以试 Seedance 2.5 的音频能力?

Vogoo 上的 Seedance 2.5 studio 直接在浏览器里跑这个模型——30 秒一镜到底生成、最高 4K、原生同步音频、单次任务最多 50 个参考素材,并且可以免费开始。套餐细节见价格页。

写在最后

只参考音频是 Seedance 2.5 里最容易被忽略的头条:在这条模型线上第一次,一段音乐、一句人声或一条音效可以成为驱动整次生成的东西,画面按声音长出来,而不是反过来。规格也给得大方——10 段素材、30 秒音频额度与视频参考分开计算——而官方案例展示了同一套 @ 语法从两段音频的守宫短片,一路撑到带音色台词的多角色舞会长镜头。如果你的工作本来就从声音开始——一个节拍、一段台词、一条配乐——这一步能把过去吃掉你半个下午的对轨环节直接抹掉。剪一段音频,声明它的职责,然后到 Vogoo 的 Seedance 2.5 studio 里跑一次,一遍就能同时听到和看到结果。

来源

  • Doubao-Seedance-2.5 企业实践手册 —— 字节跳动 / 火山引擎(飞书文档) —— 主要来源:全部音频规格(15MB、mp3/wav、2~30s 单段、10 段 / 30s 上限、时长分开计算)、7 种模态组合,以及上文引用的全部官方案例提示词。
  • Seedance 2.5 —— 一镜直出、灵活参考 · 字节跳动 Seed 博客 —— 官方发布公告,确认 30 张图片 + 10 段视频 + 10 段音频的参考额度,以及 30 秒音画一次生成。
  • Seedance 2.5 官方产品页 —— 字节跳动 Seed —— 将 2.5 定位为音画联合生成模型;确认 30s 单次生成、白模控制与基于参考的编辑能力。
  • 字节跳动发布 Seedance 2.5 视频生成模型 —— TechNode —— 2026 年 7 月 31 日在即梦 AI 与豆包 Pro 上线,API 计划通过火山引擎方舟开放。
  • 字节跳动发布 Seedance 2.5:支持 50 个参考输入的 30 秒原生 4K AI 视频模型 —— TNW —— 对 50 个参考素材上限与原生 4K 输出的独立佐证。
  • 字节跳动发布 Seedance 2.5 视频模型 —— The Information —— 行业媒体对本次发布的简报。
  • 字节跳动 Seedance 2.5:原生 30 秒 AI 视频,无需拼接 —— Tech Times —— 2026 年 6 月 23 日火山引擎 FORCE 大会首次亮相;单段连续 30 秒、无需拼接。
  • 中国 AI 视频之争选边站队:Seedance 2.5 闭源、MiniMax H3 开源 —— Tech Times —— Seedance 2.5 与 MiniMax H3 对比的竞争背景。
  • 报道称字节跳动暂停 Seedance 2.0 视频生成器的全球发布 —— TechCrunch —— 本次发布所取代的 2.0 一代的背景资料。
  • Seedance 2.0 音频输入指南 —— 火山引擎 —— 关于如何挑选干净参考音频的官方指引,也是 2.5 只参考音频模式的能力源头。
全部文章

作者

avatar for Vogoo AI 团队
Vogoo AI 团队

分类

  • 教程
什么是只参考音频音频参考规格:到底能传什么五个官方案例:从纯音频到全模态案例 1 —— 只参考音频:两只守宫的越狱会议案例 2 —— 节奏迁移:换耳机广告案例 3 —— 三模态齐上:26 秒走路长镜头案例 4 —— 音乐驱动多角色:宫廷舞会案例 5 —— 音乐配 3D 白模:飞船自己写音频 + 图片 / 视频提示词它到底差在哪音频驱动适合用在哪常见问题Seedance 2.5 的参考音频支持哪些格式?只有一首歌或一段音频,能生成视频吗?音频参考能做口型同步吗?传了音频参考,能引用的视频会变少吗?音频生成视频跟在剪辑软件里配乐有什么区别?在哪里可以试 Seedance 2.5 的音频能力?写在最后来源

更多文章

Seedance 2.5 Prompt 指南:官方 @ 引用语法完全拆解
教程

Seedance 2.5 Prompt 指南:官方 @ 引用语法完全拆解

本文系统拆解 Seedance 2.5 官方 @ 引用语法:@图片N / @视频N / @音频N 的使用声明写法、7 种模态组合、50 个参考素材(30 张图 + 10 段视频 + 10 段音频)的规格与配比原则,并附字节跳动实践手册的 5 个原版案例 Prompt,含 32 个参考素材的武侠群像。

avatar for Vogoo AI 团队
Vogoo AI 团队
2026/08/06
Seedance 2.5 视频续写延长完全指南
教程

Seedance 2.5 视频续写延长完全指南

用 Seedance 2.5 延长 AI 视频的完整方法:把已有片段作为 @视频1 喂回模型做原生时序延长,逐条拆解字节官方四段链式续写案例的中文 prompt 原文,讲清续写公式、自动锁定的画幅与时长规则、首尾帧画幅坑,以及什么时候 30 秒一镜到底比续写更划算。

avatar for Vogoo AI 团队
Vogoo AI 团队
2026/08/06
Seedance 2.5 对比 2.0:每一项升级都拆开看
新闻

Seedance 2.5 对比 2.0:每一项升级都拆开看

Seedance 2.5 与 2.0 逐项对比:30 秒一镜直出、50 个参考素材、纯音频驱动、专业级局部编辑,附官方演示实拍与「该不该现在换」的决策框架。

avatar for Vogoo AI 团队
Vogoo AI 团队
2026/08/06

邮件列表

加入我们的社区

订阅邮件列表,及时获取最新消息和更新

Vogoo.ai

按精确像素图片尺寸导出的免费 AI picture generator——从 prompt template 开始,不用裁剪直接发布。

X (Twitter)
产品
  • 文生视频
  • 图生视频
  • 文生图
  • 以图生图
  • 文生音乐
  • AI 专辑封面生成器
  • AI 传单生成器
  • AI 壁纸生成器
  • AI 圣诞照片生成器
  • 价格
AI 模型
  • Reve 2.0
  • Reve 2.1
  • Nano Banana 2 Lite
  • Seedream 5.0 Pro
  • Qwen Image 3.0
  • Seedream 5.0 Lite
  • Gemini Omni Flash
  • Flux 3
  • LTX 2.5
  • MiniMax H3
  • HappyHorse 1.0
  • Seedance 2.5
  • Seedance 2.0 Mini
  • Wan 2.7
  • iLoveSong AI
公司
  • 关于
  • 联系我们
  • 社交媒体视觉指南
法律
  • Cookie政策
  • 隐私政策
  • 服务条款
  • 退款政策
© 2026 Vogoo.ai. 版权所有。Vogoo AI Guide on Gamma