继豆包、Seedance 之后,字节又放出一张王牌

字节又又来搞事了。

在“豆博士”成为国内月活最高 AI 助手,Seedance 2.0 成为全球最强视频创作模型后,豆包ink>又发布了一个新模态的模型,Seed Audio 1.0 音频创作模型。

老狐先给大家简单介绍一下这款模型,根据官方的描述:

Seed Audio 1.0 面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面,做到“听见”即“看见”。

可以理解为,Seed Audio 1.0 创作的音频,人声、音效和环境声融合得更加自然,画面感更强。

Seed Audio 1.0 目前能输入 3000 字以内的提示词,而音频的时长,大概在 2 分钟左右,如果文本较长,语速相应就会更快。

Seed Audio 1.0 的核心能力主要体现在三个方面:

首先是一条 prompt 就能统一编排带有特定情绪的对话、音效和背景音,并且可以按照时间线精准设定声音什么时候出现,对创作者来说,这有更大的创作空间和更精准的把控能力。

二是支持参考音频输入,当需要更长时间、不同场景下的的音频内容,声音可以维持固定的音色。

比如一条 10 分钟的音频内容,可能涉及到 5 个场景,5 种情绪,就得先分段生成,再合成一起,Seed Audio 能够保持前后音色统一,也支持同一音色自然呈现不同情绪、场景和表达方式,这也让后期有更大的发挥空间。

三是支持 20 多种语言,这有利于配音、播客等等音频类工作,比如录制一段中文播客,那么就可以利用音频文件,以及对应的文本,生成多种语言的音频内容。

这对于内容出海、游戏本地化、品牌广告等等企业,在有多语言需求时,能够低成本完成语言切换。

以上就是关于 Seed Audio 1.0 的基本介绍,而评判大模型是否优秀,最后总会离不开一件事,那就是跑个分!

不过对于 Seed Audio 这种音频创作模型,并没有基准测试,所以字节官方对它进行的是一些主观评测。

在文本生成音色能力方面,Seed Audio 1.0 的得分比两个竞品都要高。而在生成音频可用率上,Seed Audio 1.0 分别比竞品高出 35% 和 22.7%,如果是高品质标准音频的生成率,Seed Audio 1.0 甚至要比竞品高出 60% 以上。

在多场景音频生成能力上,包括影视、电视节目、短剧、动漫、播客对话、直播带货等场景,多数场景中的音频可用率已达到 90% 以上。

但需要注意的是可用率,如果是对音频内容要求的品质比较高,那么多数场景的生成概率都只有 35% 以下。

多语言方面,在音频自然度上,Seed Audio 1.0 除越南语外得分都超过了 4 分,但是在更为复杂的指令遵循上,除越南语外,其他语种也都超过了 3.5 分。

但说了这么多,也都是官方评测,至于实际体验如何,还是需要用户亲自体验,而 Seed Audio 1.0 目前开放给所有用户使用,所以老狐拿它做了一些测试。

我先设置了一个宇宙太空背景,一位太空宇航员迷路,飞到了一个不知名星球上问路的场景,并且为了让对话听起来更加轻松幽默,还将外星居民设置成四川话。

这是提示词。

这是生成出来的音频。

不知道大家觉得效果怎么样,首先有个不足之处是结尾的背景音乐没有体现出来。

可能会有人觉得这个男声音色 AI 味有点浓,容易出戏,但其实可以上传参考音频,选择你自己想要的音色。

于是,我以最近非常喜欢的一段脱口秀作为文本,上传了一段参考音频,并且注明在哪个位置观众该有怎样的欢呼表现。

于是,一段周明配音版的王凯风脱口秀就出来了,节奏、情绪都是可以用的水平。

但是背景观众的欢呼声,AI 味比较浓,需要做更精准地调整,或者直接上传节目中观众的欢呼声作为参考。

在视频方面,我们尝试了将中文视频播客录音换成英文版,将中文字幕内容和时间线一起粘贴进去,就可以让 Seed Audio 1.0 生成一版英文的音频内容。

这是最终生成的音频结果。

由于英文口播要卡在原中文口播的时间内说完,所以有的地方语速会显得比较快,这里是老狐是为了突出 Seed Audio 1.0 匹配时间线的能力。

如果是纯音频播客,不加时间线限制,语速就会正常很多。

作为对比,ink data-id="3388" data-name="剪映" data-logo="https://img.36dianping.com/20250909/v2_76107abaaeea4d58be6d86bbb1731c32_oswg12259oswg256oswg256_img_000" data-classify-list="语音转文字,视频生成,视频编辑" data-refer-type="20">剪映ink>的克隆音色,仅仅只能在克隆音色基础上调整语速,后期空间有限,甚至还要消耗积分。

如果未来字节能将ink data-id="3388" data-name="剪映" data-logo="https://img.36dianping.com/20250909/v2_76107abaaeea4d58be6d86bbb1731c32_oswg12259oswg256oswg256_img_000" data-classify-list="语音转文字,视频生成,视频编辑" data-refer-type="20">剪映ink>和 Seed Audio 结合在一起,那就是王炸了。

此外,在体验过程中,我也发现了一些有意思的地方,比如在涉及到涨价的片段,文本是 “2500→4000”,音频会自动调整为“从 2500 元涨到 4000 元”。

不过在部分场景下,尤其是涉及到配乐内容时,Seed Audio 1.0 使用门槛还是高的,电影特定场景下,音乐要如何表达,乐器要如何选择,对于我这样的普通人来说,跟我在股市选股票一样,都是瞎弄。

但好在我们可以把自己的需求给 AI,让 AI 来生成提示词,事实上,第一段太空迷路的片段,正是这样完成的。

在把 Seedance 做成全球最强视频创作模型,并且在商业化方面表现亮眼后,字节 Seed Audio 终于又对音频内容出手了。

不过,这还只是 1.0 版本,考虑到字节的产品迭代能力,当 2.0、3.0 来临时,包括未来跟 Seedance 结合在一起,又会是怎样的表现呢?拭目以待吧。

本文来自微信公众号 “科技狐”(ID:kejihutv),作者:老狐;编辑:饿羊羊 ,36氪经授权发布。

发布时间:2026-07-21 22:14