尧图精选

RVC WebUI完整指南:用10分钟音频克隆声音,完成AI变声训练与使用

🕒 发布时间:2026/9/20 18:36:29 📁 来源:尧图网络
RVC WebUI完整指南用10分钟音频克隆声音完成AI变声训练与使用【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI简称 RVC WebUI是一款开源的 AI 变声工具收集 10 分钟左右的目标人声录音就能训练出一个专属音色模型再把任意音频或麦克风输入转换成该音色。它提供完整的网页操作界面支持实时变声、批量文件处理、人声伴奏分离与模型融合消费级显卡即可运行。本文按安装—训练—调参的顺序讲一遍完整流程。它能做什么三个贴近实际的使用场景直播或通话实时变声。运行python realtime_gui.pyWindows 下也可直接双击根目录的go-realtime_gui.bat在界面里选好输入/输出设备即可说话输出目标音色。README 中说明常规设备端到端延迟约 170ms使用 ASIO 设备可到 90ms。替换已有音频里的人声。在伴奏人声分离去混响去回声选项卡中用内置的 UVR5 模型从歌曲里抽出人声轨道再到模型推理选项卡的单次推理里送入人声输出保留原旋律与语调、换成目标音色的结果。批量处理音频文件。批量推理选项卡支持指定整个文件夹或一次上传多个文件转换结果写入指定输出目录默认opt导出格式可选 wav、flac、mp3、m4a。另外ckpt处理选项卡支持两个模型的音色融合界面通过 i18n/locale/ 内置了十几种语言包可按系统自动切换。跑起来之前环境要求与安装环境要求明确Python 3.12 x64Ubuntu 24.04 或 Windows 均可。先克隆仓库并创建虚拟环境git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv激活虚拟环境后按硬件安装依赖注意仓库里依赖文件名是requirments而非requirements照抄即可# CPU / AMD / Intel 显卡Windows 可用 DirectML python -m pip install -r requirments_cpu_py312.txt # NVIDIA 50 系以前的卡先装 CUDA 11.8 版 Torch再 python -m pip install -r requirments_cu118_py312.txt # NVIDIA RTX 50 系先装 CUDA 12.8 版 Torch再 python -m pip install -r requirments_cu128_py312.txt程序会根据显卡自动选择精度显存低于 4GB 或架构低于 SM 5.3 的卡退回 CPU 与 fp32较新的卡自动用 fp16。代码本身不带预训练权重需借助huggingface_hub按 README 给出的hf download命令把 HuBERT、RMVPE 与底模文件下载到assets/下对应目录assets/hubert_base/、assets/pretrained_v2/等路径是固定的不要改动目录结构。Windows 下还需 ffmpeg/ffprobe官方提供两个 exe 放到项目根目录即可。一切就绪后启动python webui.py浏览器会自动打开默认端口 7865被占用时代码会自动顺延找可用端口无桌面环境的服务器可加--noautoopen。第一次出效果数据准备、训练与试听验证训练全流程在训练选项卡完成点一键训练会自动依次执行四步数据切分、F0 与 HuBERT 特征提取、模型训练、索引训练每一步都有独立的日志和停止按钮。数据准备。把目标人声集中放到一个文件夹。项目建议录音 10~50 分钟官方 FAQ 认为音质干净、音色有个人特色的情况下 5~10 分钟也能训出可用模型低于 1 分钟不建议。录音需为单人、底噪低过长的音频文件最好先手动切短否则切分阶段容易因内存不足报错。格式上没有硬性限制任何可解码的音频文件都能处理。关键训练选项。填实验名logs/下会生成同名文件夹选目标采样率 40k/48k 与版本 v1/v2模型是否带音高指导用于唱歌克隆时务必开启官方注释唱歌一定要语音可以不要。total_epoch 默认 20FAQ 的经验是底噪大的数据 20~30 轮足够音质高、时长多的数据可以往上加。batch_size 有一键训练的自动值显存吃紧就往下调。试听验证。训练结束后assets/weights/下会出现约 60MB 的小模型.pth并生成配套的 .index 索引。到模型推理选项卡点刷新音色列表选中模型上传一段测试音频点转换即可听到结果。不满意时调整变调、index_rate 再试或用ckpt处理里的模型提取、融合功能处理中间轮次的权重。参数怎么设按实时、离线、批量三种诉求推理的核心参数有变调半音数0 不变12 升八度、音高提取算法pm/rmvpe/fcpe、检索特征占比 index_rate0~1、清辅音与呼吸声保护 protect0~0.5、音量包络融合比例 rms_mix_rate0~1。诉求建议实时低延迟音高提取选 rmvpe默认速度快使用 ASIO 输入输出设备实时界面的 block_time、crossfade_length、静音阈值 threhold默认 -60dB可按听感微调离线高质量训练集音质高时把 index_rate 调高接近 1锁定音色训练集音质低于输入源时调到 0.5 左右让输入音质带高结果protect 保持 0.33出现电音撕裂时调低加强保护用 48k 采样率训练、后处理重采样设为 0批量处理用批量推理默认 index_rate 为 1按需选导出格式mp3 可显著减小文件体积音高算法与单次推理一致index_rate 的作用官方 FAQ 有专门科普调高后输出更贴近训练集音色能抑制输入源和底模的音色泄露但如果训练集本身音质偏低一味调高反而会拉低输出音质需要权衡。新手常见的几个卡点报 ffmpeg error / utf8 error。大概率不是 ffmpeg 本身的问题而是路径问题路径里带空格、括号或训练集用了中文路径。把目录改成简短的纯英文路径再跑即可。CUDA out of memory。即显存不足。训练时调低 batch_size降到 1 还爆显存只能换卡推理时可调小configs/config.py末尾的 x_pad、x_query、x_center、x_max。4GB 以下显存的卡不建议尝试训练。训练完找不到音色或一键训练结束没有索引。先到模型推理点刷新音色列表仍没有就检查assets/weights/是否生成了 .pth。一键训练提示完成但缺少 added 开头的索引文件多是训练集太大卡住了索引步骤重新点一次训练特征索引即可。WebUI 显示 Connection Error 或 Expecting value。前者通常是把黑色控制台窗口关了后者是系统局域网/全局代理包括服务器端 http_proxy拦截了本地请求关掉代理重启程序。更多问题可查项目内的 常见问题解答WebUI 里也内置了同名选项卡。下一步跑通第一个模型后可以继续补充不同情绪和语调的录音开新实验继续训练或用模型融合把两个音色合成新音色这两个方法 FAQ 里都有对应条目。各版本的具体改动可跟踪更新日志。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →