RVC变声实操指南:用10分钟语音训练出你的AI音色
RVC变声实操指南用10分钟语音训练出你的AI音色【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUIRVC是基于VITS架构的开源语音转换框架10分钟目标音色的音频就能训出一个变声模型。读完本文你能在网页界面完成训练、生成索引并把一段普通录音转成目标音色。一、准备工作环境与数据清单先对照下表检查机器和素材全部满足后再进入安装。组件要求为什么是这个值Python3.83.1064位依赖中的llvmlite固定在0.39.0更新版本安装会冲突PyTorch2.0CUDA与显卡驱动匹配训练和推理的核心版本不匹配会在启动时报CUDA错误ffmpeg最新版并加入PATH切片、归一化、格式转换全靠它缺失会导致音频处理失败显卡N卡显存≥4GBA卡/I卡可用DML方案显存直接决定batch_size4GB以下基本只能推理训练数据1050分钟低底噪单人音频太少音色不稳太多只是拉长训练时间磁盘空间≥10GB可用预训练底模加训练checkpoint要占几个GB数据侧建议文件路径用纯英文单段音频控制在10秒左右混音歌曲先用工具抽干人声再进训练集。二、核心流程从代码到变声的6步第1步 克隆项目做什么拿到源码进入项目目录。怎么做git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI怎么算成功目录下能看到 infer-web.py、configs、assets 等条目。第2步 安装依赖做什么建独立虚拟环境装PyTorch和项目依赖。N卡装 requirements.txtA卡/I卡改装 requirements-dml.txt。怎么做python -m venv venv pip install torch torchvision torchaudio pip install -r requirements.txt怎么算成功安装过程无报错且命令行里 ffmpeg -version 能输出版本号。第3步 下载预训练模型做什么拉取训练所需的hubert、rmvpe、底模和UVR5声伴分离模型。怎么做python tools/download_models.py怎么算成功assets/hubert、assets/pretrained、assets/pretrained_v2、assets/uvr5_weights 里出现对应的 .pt / .pth 文件。第4步 启动WebUI做什么打开网页操作界面。怎么做python infer-web.py怎么算成功浏览器自动打开 http://localhost:7865页面有模型推理训练ckpt处理Onnx导出四个页签。注意这个控制台窗口不要关关了页面就连不上了。第5步 训练音色模型做什么在训练页签填写实验名如 mi-test、目标采样率选40k、勾选模型带音高指导唱歌必选、版本选v2填入训练音频文件夹路径。怎么做直接点一键训练它按固定顺序执行——切片归一化→提取音高和特征→训练模型→训练索引。怎么算成功输出信息出现全流程结束logs/mi-test 下有 G、D 开头的checkpoint文件且生成 added_ 开头的 .index 索引文件。第6步 推理变声做什么把待转换的音频丢给新训的音色。怎么做切到模型推理页签先点刷新音色列表和索引路径在下拉框选中 mi-test填入输入音频路径音高提取算法选rmvpe点转换。怎么算成功输出区域出现可播放的音频音色接近目标声线且听不出原说话人的痕迹。三、参数怎么调参数推荐值作用什么时候需要动total_epoch 总训练轮数20默认训练轮数越多越贴合训练集数据干净且时长足可加到100200底噪大保持2030batch_size界面自动按显存/2预填每张卡的训练批次决定显存占用显存爆了就减半降到1还爆只能换卡save_every_epoch5每N轮存一次checkpoint想多留中间模型试听时调小目标采样率40k输出音质上限追求更高音质选48k代价是更吃显存版本v2底模代次v2特征维度更高新手直接选v2即可index_rate 检索特征占比推理0.75混合训练集特征的强度压制源音色泄露输出还残留原音色就调高音质变糙就调低protect 保护力度推理0.33保护清辅音和呼吸声防电音撕裂听见撕裂声调低音色发闷则调高CPU进程数界面按核数预填切片和特征提取的并行度系统内存报error时往下拉低其余滑块变调、rms_mix_rate、resample_sr0等先保持默认确定基础流程跑通后再逐项对比试听。四、出问题了现象原因解法CUDA out of memory显存不够batch_size减半重训4GB显存卡设12提示找不到llvmlite.dll缺Windows C运行库安装Visual C Redistributable后重启WebUIExpecting value: line 1 column 1系统代理拦截了本地请求关闭局域网/全局代理含服务器端代理也要unset一键训练结束却没有索引文件索引添加环节被大特征卡住手动再点一次训练特征索引按钮推理页选不到新训音色音色列表未刷新点刷新音色列表和索引路径仍没有则回查logs下的train.log五、一个完整案例场景把清唱录音换成某歌手音色做翻唱。数据18分钟从成品歌曲里用UVR5分离出的干人声切成约100段硬件RTX 3060 12GB配置40k采样率、v2版本、带音高指导total_epoch20batch_size6耗时切片加特征提取约15分钟训练约40分钟建索引约5分钟效果推理端 index_rate0.75、protect0.33、变调0音色贴合度高无明显源音色泄露人声再与伴奏重新混音即可成片如果只想做说话场景的变声不做唱歌训练时可以不勾音高指导模型会更轻推理也更快。六、延伸资料中文常见问题docs/cn/faq.md英文文档目录docs/en/核心推理库infer/lib/训练脚本预处理/特征提取/训练入口infer/modules/train/WebUI主程序infer-web.py预训练模型下载脚本tools/download_models.py更新日志docs/cn/Changelog_CN.md收尾建议首跑保持全部默认参数只改实验名和训练文件夹路径跑通后每次只动一个变量再对比试听。混音歌曲先过UVR5抽干人声再训练带伴奏的训练集会直接拉低音质。把调出满意效果的那组 index_rate 和 protect 值记下来复用它们比每次盲调更快。训练有异常先看 logs/实验名/train.log绝大多数报错都能在里面找到第一现场。要分享的模型是 weights 文件夹里60MB以上的小模型不是 logs 下几百MB的大checkpoint。流程一旦跑通剩下的只是数据积累和反复试听的功夫。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →