字节跳动Seed官方今日发布了音频创作模型Seed Audio 1.0,面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。
PChome 7月20日消息,字节跳动Seed官方今日发布了音频创作模型Seed Audio 1.0,面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。

据官方透露,其产品核心能力主要体现在多要素统一编排,支持精细的时间控制,一条prompt即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场;音色风格可控,长时稳定,支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪;多语种自然生成,支持20+语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。


据悉,在文本生成音色能力上,Seed Audio 1.0在AB主观评测中表现出显著优势,可用率和优良率也明显提升。同时在多场景音频生成能力上,官方评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示,多数场景中的音频可用率已达到90%以上。