RVC 变声器完整实战教程:5 步跑通环境安装、训练、参数调优与模型分享
RVC 变声器完整实战教程5 步跑通环境安装、训练、参数调优与模型分享【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUIRVC是一个语音转换框架用 10 分钟以内的音频数据就能训练出一个可用的变声模型。下面按你实际操作任务的顺序走先装好环境跑起来再备数据、训模型、调参数最后把成果整理成能分享的成品。每个环节都给到可以直接照抄的数值不做适当调整这种模糊表述。RVC 分显卡类型安装依赖并启动 WebUI装 RVC 只需要两条单行命令选错依赖文件才会出问题。先按你的硬件查表硬件情况装 PyTorch装依赖启动方式Nvidia 显卡pip install torch torchvision torchaudiopip install -r requirements.txtWindows 双击go-web.bat或python infer-web.pyAMD 显卡Windows同上pip install -r requirements-dml.txt双击go-web-dml.batIntel 核显同上pip install -r requirements-ipex.txtpython infer-web.py无独显 / Mac同上pip install -r requirements.txt./run.sh脚本会自建 venv 并拉取底模Nvidia RTX 30 系列若遇到 CUDA 报错改用官方索引安装pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117启动后浏览器会打开 7865 端口的 WebUI。两个安装期高频报错先记结论OSError: Could not load shared object file: llvmlite.dll→ 装 Visual C 运行库重启 WebUI 即可。音频处理阶段 FFmpeg 相关报错、或索引路径提示含中文 → 把 RVC 克隆目录和音频素材都放到纯英文路径下例如D:\rvc\src。仓库克隆地址https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI。RVC 训练集准备时长、质量与训练轮数取值表训练集不是越长越好是越干净越好。判断标准就三条人声清晰、背景噪音低、说话人音色和情绪稳定。把多段音频统一成同一种格式如 wav、44.1k再丢进训练文件夹能省掉切片归一化阶段的不稳定。训练集时长适合预期效果建议 total_epoch1-2 分钟音色特征非常鲜明的声音能换出音色轮廓20 左右5-10 分钟质量不错的语音样本音色还原良好50-10010-30 分钟主力区间音质明显更好100-20030-50 分钟覆盖多种说话场景表现稳定全面200 起步观察 loss 决定两条反直觉的取值数据本身音质差底噪大、混响重时total_epoch 压到 20-30。轮数越多噪音被学进模型得越牢。高质量数据才值得上 150-200 轮同时勾选缓存所有训练集至显存10 分钟以内的小数据集开缓存能明显加速训练大数据集别开显存会炸且提速有限。RVC 训练不翻车常见报错症状诊断清单训练页的三步是固定顺序step2a 处理数据切片归一化→ step2b 特征提取CPU 提音高 GPU 提特征→ step3 训练模型与索引。报错基本只发生在后两步按症状对号入座症状日志/控制台原文先做哪个动作Cuda out of memory训练时batch_size 直接减半重试减到 1 仍炸就换卡或关缓存至显存选项Cuda out of memory推理时改 configs/config.py 里的x_pad / x_query / x_center / x_max4G 显存一组是1 / 5 / 30 / 32训练结束提示 Training is done. The program is closed.但没有生成.index文件训练集太大导致建索引时内存不足。去训练页单独点训练特征索引补跑仍失败就分批处理推理页音色下拉框里找不到刚训好的模型先点刷新音色列表和索引路径再确认weights文件夹里有对应.pth且训练日志无致命错误The size of tensor a (24) must match the size of tensor b (16)训练集里混了异常音频。检查logs实验目录下wavs16k等文件夹删掉体积显著偏小的坏文件重跑处理数据Expecting value: line 1 column 1 (char 0)本地代理在干扰网络请求。关掉全局代理、清掉环境变量里的http_proxy/https_proxy重启 WebUI排查入口永远是实验文件夹下的train.log和logs目录别只看网页弹窗里的一句话。显存紧张时也可以把batch_size和提取音高用的 CPU 进程数同时调小前者管显存、后者管内存。index_rate 参数取值对照与调音顺序调参从模型推理页开始按这个顺序动滑块先定 f0 偏移 → 再定 index_rate → 最后碰 filter_radius。index_rate决定像不像原唱的关键index_rate听感特点适用场景0.3-0.5自然轻微保留输入音色日常对话、聊天变声0.6-0.8目标音色明显占主导配音、模仿特定歌手0.9-1.0几乎完全替换成训练音色基本不泄露输入嗓音对音色保护要求高的场合注意 index_rate 拉到 0 时索引检索完全不生效也就没有任何防音色泄露的作用。另外训练集质量越高index_rate 越可以往低走训练集差就守在 0.8 以上。其余滑块给默认值参数默认起点怎么动f0_change音调偏移半音0男转女 12 起步女转男 -12 起步±4 内微调变调 key0与 f0_change 作用相近二选一即可filter_radius音色平滑3输出发毛就调大到 5-8太糊就调小RVC 模型管理与分享小模型提取和 .index 配套训练完的原始文件在logs的实验目录里是几百 MB 的大 ckpt不能直接拿去分享。成品整理成四步打开ckpt处理页 → 模型提取输入 logs 下的大模型路径如.../G_20.pth。确认三项信息目标采样率32k/40k/48k、是否带音高指导唱歌选带纯语音可不带、模型版本v1/v2。提取大模型路径后这三项会自动识别。填保存名后点提取得到weights文件夹下 60MB 左右的小模型.pth。把同实验名对应的.index文件和.pth放在一起交给对方——推理时两者都选中。❌ 分享logs下几百 MB 的.pth大文件 ✅ 分享weights下提取好的 60MB 左右.pth 同名.index❌ 只发模型文件漏掉索引效果会差一截 ✅ 两个文件配套发送并告知对方训练时的采样率再记三个进阶用法训练中途反悔哪怕没训满轮数也能对中间的G_xxxx.pth执行第 1-3 步提取出可用小模型。模型融合ckpt处理页的融合功能支持把 A、B 两个模型按权重默认各 0.5混合用来试音色组合。改采样率没有捷径想从 40k 模型变成 48k必须新建实验名重训一遍但之前提取的音高和特征可以复用能省掉大半预处理时间。收尾两句实验跑多了就清理logs下不用的旧实验目录把configs/config.py改过的参数记下来避免下次换机要重调。遇到新报错顺序固定——查train.log→ 核对依赖是否装对了文件 → 用最小数据集复现。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →