基于本地后端的语音克隆与说话人分离演示
当前页面统一接入本地 standard 后端,lite 和 premium 选项会映射到同一套可用模型。
拖拽音频到此处,或点击选择文件
支持格式: WAV、MP3、M4A、OGG、FLAC
上传包含多位说话人的音频以进行分离
上传多个参考音频,批量生成克隆结果