英伟达发布音频模型 Fugatto:用文字操控声音的“瑞士军刀”

Fugatto 通过文本提示创建音乐片段、移除或添加乐器、改变声音中的口音或情感,甚至生成人们从未听过的声音;Fugatto 应用于音乐制作、广告代理、语言学习和视频游戏开发,提供多地区、多情境的目标定位和个性化声音;Fugatto 使用25亿参数的基础生成性 Transformer 模型,结合 ComposableART 技术,实现对文本指令的细粒度控制,并在 NVIDIA DGX 系统上训练。

搜索