RVC变声WebUI使用指南:如何用10分钟音频练出一个变声模型
RVC变声WebUI使用指南如何用10分钟音频练出一个变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI常简称 RVC是一个基于 VITS 的语音转换框架10 分钟低底噪录音就能训出可用的变声模型4GB 显存的显卡也能跑实时变声延迟 170ms。一、它替你省了什么做配音时想要一个不像自己的声音、直播打游戏想实时变声、给歌曲换个音色重新混音——这些需求如果靠人声模仿或逐句后期成本都不低。RVC 把这套流程压缩成录音 → 训练 → 转换三步并替你处理了几件麻烦事杜绝音色泄漏推理时用 top1 检索把输入特征替换成训练集特征通俗说就是强制用目标角色的音色特征而不是你本人的你的原音色不容易混进结果里。训练门槛低推荐 10 分钟低底噪语音起步普通显卡也能较快训完。自带人声分离集成 UVR5 模型先把歌里的人声和伴奏拆开再对人声部分转换。模型可融合ckpt 处理选项卡里的 ckpt-merge 能把两个模型权重混在一起微调音色。实时可用端到端 170ms 延迟接 ASIO 声卡时最低约 90ms。二、三分钟跑起来 环境只要求 Python 3.8 和 ffmpegWindows 可把 ffmpeg.exe、ffprobe.exe 放到根目录Ubuntu 用sudo apt install ffmpeg。依赖安装按显卡选一条即可pip install torch torchvision torchaudio pip install -r requirements.txt # N卡 pip install -r requirements-dml.txt # A卡/I卡DirectML pip install -r requirements-amd.txt # A卡 ROCmLinux pip install -r requirements-ipex.txt # I卡 IPEXLinux然后补齐预训练文件assets/hubert/hubert_base.pt、assets/pretrained、assets/uvr5_weights用 v2 底模还需assets/pretrained_v2以及放在根目录的rmvpe.pt音高提取模型。tools/ 目录里有现成的下载脚本。最后启动python infer-web.py界面默认监听 7865 端口并自动打开浏览器。I 卡用户启动前先执行source /opt/intel/oneapi/setvars.shWindows 整合包用户直接双击go-web.bat即可无需上面这些步骤。三、从素材到成品的完整流程准备数据把 1050 分钟纯净音频放进todo-songs/。判断做对了听一遍没有背景音乐、底噪低单条文件别切太长过长容易导致训练时内存溢出。音频预处理在 WebUI 的训练选项卡点音频预处理自动切片并转成 16k 格式产物在wavs16k/。判断做对了切片数量合理且没有大小明显偏小的异常文件——有就必须删掉否则后面会报 tensor size 错误。提取音高默认用 RMVPE效果最好且比 crepe 快也可选 harvest、crepe、pm。判断做对了控制台无报错实验目录下生成 0/1/2/2b 等音高特征文件夹。训练模型选底模版本v1/v2与采样率40k/48k设好 epoch 点一键训练。数据一般 2030 个 epoch 就够音质高、时长足可以加到 200。判断做对了控制台打印训练完成之后紧跟的个别报错是假报错可忽略。训练索引一键训练会自动做如果没看到added_开头的索引文件通常是训练集太大卡住了再单独点一次训练索引。推理验证切到模型推理选项卡选音色weights 里的模型 索引 音高提取方式送入音频。判断做对了音色接近训练目标、不破音若结果里混进你本人的音色把 index_rate 调高。四、进阶玩法直播与实时变声党Windows 下双击go-realtime-gui.bat打开实时界面可以边说话边变声并实时调音高170ms 延迟对绝大多数场景够用ASIO 设备能压到 90ms但很依赖声卡驱动。内容创作者先用伴奏人声分离选项卡把歌曲拆出人声再在批量推理选项卡一次转换整批文件最后与原伴奏重新混音。想进自己的流水线可以用 tools/infer_cli.py 这类命令行脚本参数包括 f0 偏移、索引路径、index_rate 等。模型调教党ckpt 处理选项卡里用 ckpt-merge 混合两个模型的权重来微调音色想继续训练训练中途保存的大模型先点提取小模型得到 60MB 的可分享 pth中途想加数据新建实验名并把上次的 G、D 文件拷过去即可接着训。五、踩坑与调优手册 ️症状原因解法ffmpeg error / utf8 error音频路径带空格、括号或中文把音频挪到纯英文路径下Cuda out of memory显存不足训练调小 batch size推理调小 configs/config.py 末尾的 x_pad、x_query、x_center、x_max4GB 显存用 1/5/30/32推理选不到新音色未刷新音色列表或训练失败点刷新音色再查logs/实验名下的日志结果里混入本人音色index_rate 偏低逐步调高至 1代价是音质更贴近训练集tensor size 不匹配报错wavs16k 里混入异常小切片找出明显偏小的文件删掉重训一键训练后没有索引训练集太大加索引步骤卡住单独再点一次训练索引llvmlite.dll 加载失败Windows缺 VC 运行库安装 VC Redist 后重启 WebUI更完整的问答见 docs/cn/faq.md。另外 4GB 及以下显存的显卡会自动切 fp32 并降低缓存参数老卡1060、1080 等不需要你手动处理。六、内部构造一览整条推理链路一句话就能串起来输入音频先做音高提取再由 Hubert 编码器取出内容特征top1 检索用训练集特征替换掉源特征最后经 Synthesizer 合成波形输出——核心类 RVC 就在 infer/lib/rtrvc.py 里。路径职责infer/核心推理含 RVC 主类、UVR5 人声分离、训练脚本infer/lib/jit/Hubert、RMVPE、Synthesizer 三个模型的 JIT 编译加载infer/lib/infer_pack/VITS 网络结构与注意力定义infer/modules/train/数据预处理、音高提取、训练入口configs/v132k/40k/48k与 v232k/48k采样率配置inuse/ 是运行时副本config.py 启动时自动拷贝并按显存调整参数assets/预训练底模与你的训练产物weights/、indices/tools/命令行推理、批量推理、模型下载、模型相似度计算等脚本i18n/13 种语言的界面翻译包七、怎么选硬件4GB 显存能跑自动降精度 降缓存低于 4GB 建议放弃训练8GB 以上体验更顺。数据量1050 分钟是稳妥区间音质高且音色有辨识度的话 510 分钟也成立。参数起点底模选 v2 48k 采样率epoch 从 30 左右开始试index_rate 先用默认值发现音色泄漏再往 1 调。把一段干净的录音丢进todo-songs/执行python infer-web.py在训练选项卡按一次一键训练听第一版效果。如果音色没贴住目标第一个要动的旋钮就是 index_rate。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →