超越OpenAI、ElevenLabs?MiniMax新一代人格化语音模型

MiniMax新一代语音模型Speech-02在Artificial Analysis榜单上超越OpenAI和ElevenLabs,在字错率和说话人相似度等指标上达到SOTA水平;Speech-02实现了真正的零样本语音克隆,并采用创新的Flow-VAE架构,只需几秒音频即可高度还原说话人音色、语调和节奏;该模型支持32种语言,可实现任意音色灵活控制和情感调节,成本仅为ElevenLabs竞品的1/4,标志着AI语音进入人格化时代。

搜索