尧图精选

RVC 语音克隆实战教程:从环境配置到第一次变声,30 分钟出第一个模型

🕒 发布时间:2026/9/3 13:28:34 📁 来源:尧图网络
RVC 语音克隆实战教程从环境配置到第一次变声30 分钟出第一个模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI是一款开源变声框架新手用 10 分钟录音就能克隆出一个人专属的 AI 音色之后任何音频都能换成这个声音。本文带你走完「装环境 → 启动 WebUI → 训练模型 → 跑通第一次变声」的完整闭环面向零基础用户命令全部可照抄。中途掉坑下文「掉坑了怎么办」一节有答案对号入座就行。适合谁、不适合谁 先说清项目能干啥避免白折腾数据门槛低10 分钟低底噪录音就能出可用模型作者用 5 分钟数据也训练成功过硬件友好NVIDIA、AMDDirectML、Intel 核显IPEX都有对应加速方案显存 4G 只能做推理训练建议 6G 以上内置工具链UVR5 人声伴奏分离、RMVPE 音高提取、模型融合都在同一个网页里不用东拼西凑防音色泄漏推理时用 top1 检索替换输入特征输出的声音不会残留原音色的影子。明显不适合显存 4G 以下还想自己训练的场景。替代做法只用云端 GPU 或租机器训练本地只做推理或者干脆直接用别人训好的公开模型变声。怎么跑起来 三样东西备齐再动手Python 3.8 以上、与显卡匹配的依赖、FFmpegWindows 用户把ffmpeg.exe、ffprobe.exe放到项目根目录即可加预训练模型。依赖选型照表抄你的环境安装命令说明NVIDIA 显卡pip install -r requirements.txt大多数用户的选择AMD 显卡Windowspip install -r requirements-dml.txt走 DirectML 加速AMD 显卡Linuxpip install -r requirements-amd.txt需先装 ROCm 驱动Intel 显卡Linuxpip install -r requirements-ipex.txt走 IPEX 加速 懒人方案Windows 用户可直接下载整合包解压双击go-web.bat就启动跳过下面所有手动步骤。预训练模型不想手搬的运行python tools/download_models.py批量拉取assets/hubert、assets/rmvpe、assets/pretrained、assets/uvr5_weights等目录想用 v2 版本模型还要有assets/pretrained_v2。获取代码并安装依赖git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt启动 WebUIpython infer-web.py看到什么算成功控制台滚完日志后打印本地地址浏览器自动打开http://localhost:7865页面出现「变声 / 训练 / 模型推理 / ckpt 处理」等标签页就算跑通了。端口被占就换端口python infer-web.py --port 7861。⚠️ 最常见的误操作把启动时弹出的黑色控制台窗口关了。这个窗口就是后端服务本体一关浏览器立刻 Connection Error。想停止服务请关它想看界面别关它。怎么做出来 核心流程六步每步在 WebUI「训练」标签页里点按钮就行很机械。填实验配置——给这次训练起个名数据落在logs/实验名下。关键参数输入实验名如mi-test纯英文、目标采样率默认 40k、模型是否带音高指导翻唱必选纯语音可不选。处理数据——把长音频自动切成训练用的等长片段并归一化。关键参数输入训练文件夹路径里面放你的录音WAV 优先单声道10~30 分钟先去底噪、剪静音。特征提取——生成 F0 音高数据和声学特征是训练的原料。关键参数音高算法选rmvpe_gpu显存紧张就退回rmvpe。开始训练——按轮数跑模型过程不断产出G_xxx.pth生成器和D_xxx.pth判别器。关键参数总训练轮数 total_epoch默认 20、每张显卡的 batch_size、保存频率 save_every_epoch默认 5。生成索引——训练完点「训练索引」产出added_xxx.index特征检索库这个文件在推理时用来把声音锁在目标音色上。提取小模型——到「ckpt 处理」标签页做小模型提取把训练存档转成 60MB 的轻量.pth存进assets/weights这个才是能直接推理和分享的模型。参数怎么选total_epoch按素材质量给区间——数据有底噪、20~30 轮封顶音质干净、素材足大胆拉 50~200。盲目加轮数不会让低质量数据变好听。batch_size显存 6G 左右从 8 起试爆显存就减半。怎么做好 模型能跑了声音不像、不够自然先调这三个参数都在「模型推理」标签页变调按半音升降调12升八度、-12降八度0不变。作用一句话控制音高高多少。建议区间男翻女 8~12、女翻男 -8~-12。走极端如 ±24音高脱离人声正常范围出来的是怪物音。检索特征占比Index Rate越大越像训练集音色越小越自由。建议区间 0.5~0.9清唱素材从 0.7~0.8 起带伴奏的 0.5~0.6。走极端拉满到 1 会牺牲音质变机械压到 0 会混进原音频的音色即「音色泄漏」。F0 音高算法rmvpe效果最好且微吃显存默认就选它harvest低音好但巨慢crepe吃 GPUpm最快适合纯语音提速场景。走极端选错算法配错素材如对唱歌用 pm跑得快但音高不准副歌直接破音。调完参数还不行按这个优先级排查数据性价比最高。诊断问句训练集里有没有底噪、爆音、其他人的声音素材是不是同一个音色最有效动作重新剪一遍素材去掉噪音段只留干净单人录音——这一步比任何调参都管用。参数。诊断问句Index Rate 试过 0.5、0.6、0.7 三档吗最有效动作每次加 0.1 逐个试听记录最顺耳的值。采样率配置。诊断问句你的素材和目标用途配 40k 还是 48k最有效动作音乐/配音选 48k实时变声选 40k 以下。训练中途千万别改采样率改了只能换实验名从头训。掉坑了怎么办 ️报错一ffmpeg error / utf8 error。原因不是 ffmpeg 坏了是音频路径含空格、括号或中文。解法音频改名、挪到纯英文无空格路径重跑。报错二WebUI 弹 Expecting value 解析错误。原因几乎全是系统代理全局/局域网代理干扰了 JSON 请求。解法关掉代理同时 unset 服务器端http_proxy环境变量重启 WebUI。报错三llvmlite.dll 缺失。原因Windows 缺 Visual C 运行库。解法装好 vc_redist 安装包重启电脑。报错四CUDA out of memory。原因显存不够。解法训练侧把 batch_size 减半推理侧到 configs/config.py 把x_pad、x_query、x_center、x_max调小4G 显存参考 1/5/30/32。报错五tensor 尺寸不匹配。原因二选一训练目录里有异常短音频或中途改过采样率。解法检查wavs相关目录删掉明显偏小的文件改过采样率的只能换新实验名从头训。报错六训练完成了但没有added_索引文件。原因训练集太大导致索引生成卡住。解法确认控制台出现 Training is done 提示后手动再点一次「训练索引」。报错七推理列表里找不到新模型。原因训练中断或文件位置不对。解法先点「刷新音色列表和索引路径」还没有就翻logs/实验名下的日志和 官方 FAQ 对报错。 综合排查提示如果报内存不足Memory error多半是 CPU 进程开太多把「提取音高和处理数据使用的 CPU 进程数」调低同时手工把训练音频切短一点再跑。收尾 把全流程串起来备环境 → 起 WebUI → 处理数据 → 特征提取 → 训练 → 训练索引 → 提取小模型 → 推理变声。最后点破一件事真正决定效果的从来不是参数玄学而是训练数据够不够干净、音色够不够统一——10 分钟干净录音效果稳赢 1 小时带噪音的素材。想分享模型给别人记住logs/实验名下的 pth 是训练存档几百 MB不能直接给人推理用要打包的是assets/weights里的小模型 added_xxx.index索引文件工具都在 tools/infer/。最小起步动作找一段 10 分钟的干净录音今天就把流程从第一步跑到第六步走通一遍跑通之后再谈调优。去吧你的第一个克隆音色离你只差一条python infer-web.py的距离。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →