7 月 21 日消息,字节跳动 Seed 团队昨日发布 Seed Audio 1.0,用统一框架同时建模人声、音效和环境声,用一条指令组织角色、台词、情绪、背景与声音进场时机。

时间控制:模型会将创作意图拆成结构化时间线,目前支持 100ms 间隔精度。
音色与时长:支持文本或参考音频输入,单次可生成约 2 分钟音频,并可继续延长,保持角色音色与表达方式一致。
多语种:覆盖中文、英文、日语、韩语、西班牙语等 20 多种语言,同一音色可随目标语言调整节奏、重音和情绪。
官方在影视、动漫、播客对话、直播带货、话剧和语音合成等场景进行评测,称多数场景的音频可用率超过 90%。Seed Audio 1.0 已在火山方舟体验中心上线;后续计划支持视频参考、长音频和分轨等输入与生成方式。