字节发布 Seed Audio 1.0 音频创作模型:支持精细时间控制,音色风格可控、长时稳定

发布于

IT之家 7 月 20 日消息,字节跳动 Seed 官方今日发布了音频创作模型 Seed Audio 1.0,面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。

![Seed Audio 1.0](http://pic.zhso.org/2026/07/20/39d8e5962722.jpg)

官方宣称,声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到“听见”即“看见”,其核心能力主要体现在以下方面:

- **多要素统一编排,支持精细的时间控制**:一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场。
- **音色风格可控,长时稳定**:支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。
- **多语种自然生成**:支持 20+ 语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。

据介绍,在文本生成音色能力上,Seed Audio 1.0 在 AB 主观评测中表现出显著优势,可用率和优良率也明显提升。

![音频生成评测](http://pic.zhso.org/2026/07/20/217893cbe468.png)

在多场景音频生成能力上,官方评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示,**多数场景中的音频可用率已达到 90% 以上**。

![多场景音频生成](http://pic.zhso.org/2026/07/20/411555f26f39.png)

针对多语言音频生成能力,在音频自然度上,大部分语言的 MOS 超过 4 分,音质已达到优秀水准;在复杂音频生成的指令遵循上,除越南语外,其余语言的 MOS 均高于 3.5 分,表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

![多语言生成能力](http://pic.zhso.org/2026/07/20/861e1faf4bb5.png)

目前,Seed Audio 1.0 已在火山方舟体验中心上线,IT之家附相关链接:
[https://seed.bytedance.com/seedaudio1_0](https://seed.bytedance.com/seedaudio1_0)

---

原文链接:[点击查看](https://www.ithome.com/0/979/008.htm)

评论

暂无评论。