RVC 快速上手完整指南:10 分钟语音训练出可用的语音转换模型
RVC 快速上手完整指南10 分钟语音训练出可用的语音转换模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI基于检索的语音转换是一个面向普通用户开源的语音转换项目你给它 10 分钟以内的干净人声它就能训出一个可用的音色转换模型再用这个模型把你的声音换成目标音色。本文带你从零装环境、到批量换音色、再到训练自己的模型全程按做完一步再走下一步的节奏推进新手照抄命令即可进阶参数也备好了位置。三步跑通快速体验最短路径克隆仓库 → 装依赖 → 下载预训练模型 → 启动 WebUI。# 1. 克隆项目只需这一条命令涉及外部地址 git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI # 2. 安装依赖Nvidia 卡 / CPU / DirectML 用户装这份 pip install -r requirements.txt # 3. 下载全部预训练模型hubert、rmvpe、v1/v2 预训练、uvr5 人声分离权重 python tools/download_models.py# 4. 启动 WebUI浏览器默认打开 http://127.0.0.1:7865 python infer-web.py打开页面后你会看到四个功能区人声与伴奏分离、变声模型训练、推理批量转换、模型文件管理。此时项目已可完成全部核心操作。[!TIP] Windows 用户如果不想折腾命令行仓库根目录的go-web.batNvidia/CPU和go-web-dml.batDirectML可以双击直接拉起环境实时变声对应go-realtime-gui.bat/go-realtime-gui-dml.bat。按硬件选安装路线一张表对号入座先判断你手里是什么硬件再决定装哪份依赖文件装错路线是最常见的启动失败原因。你的硬件安装方式说明Nvidia 独立显卡pip install -r requirements.txt默认路线CUDA 加速训练和推理最快AMD 显卡pip install -r requirements-amd.txt依赖 ROCm 版 PyTorch需先装好 ROCm 环境的 torchIntel 核显 / CPUIPEXpip install -r requirements-ipex.txt基于 Intel Extension for PyTorch适合无 N 卡机器Windows 无 N 卡DirectMLpip install -r requirements-dml.txt启动时记得加--dml参数走 torch_directmlmacOSpip install -r requirements.txt有 MPS 加速会自动走 mps否则回退 CPU自动降为 fp32Python 版本要求 3.8 及以上项目锁定了 torch 2.0 系列见 pyproject.toml推荐 3.9。另外系统必须装有 ffmpeg音频切割靠它# Ubuntu / Debian sudo apt install ffmpeg # macOS brew install ffmpeg # Windows把 ffmpeg.exe 和 ffprobe.exe 放到项目根目录即可程序启动时会自动探测设备检测到显存 ≤4GB 会把预处理步长从 3.7 降到 3.0检测到 mps/cpu 会自动切换 fp32 配置逻辑见 configs/config.py这些你不需要手动干预。功能实操三个场景各给最小参数集场景一批量转换音频推理在推理页签完成最小参数集四个参数建议值作用索引率 index_rate0.0 ~ 0.5检索相似度权重越高越贴近原音色过高会出现电流杂音音调 shift-12 ~ 12半音整体升降调女转男通常 -2 左右男转女 4 ~ 12音高提取方法 F0 方法rmvpe基频F0提取器实时场景常用 fcpe/pm精度与速度各有取舍采样率48k32k/40k/48k 三档越高音质越好、速度越慢流程选择.pth模型 → 选择.index索引 → 上传音频 → 点转换结果在opt/目录。场景二实时变声低延迟启动独立 GUI# 实时变声界面PySimpleGUI默认块处理时间 0.25s python gui_v1.py最小配置四步① 选输入/输出音频设备② 加载.pth模型和.index索引③ F0 方法选rmvpe或fcpe界面默认 fcpe④ 点 Start。关键旋钮只有两个参数默认调节方向阈值 threshold-60 dB环境吵就调高如 -50避免噪音触发变声相似度 index_rate0.0实时场景建议 ≤0.3保延迟代码默认block_time0.25s分块处理见 gui_v1.py配合 WASAPI 独占/ASIO 类设备可把端到端延迟压到百毫秒内适合连麦和游戏语音。场景三训练自己的模型数据要求很苛刻但量很少10 分钟以内、低底噪的干净人声WAV底噪大比数据少更伤模型。在训练页签输入模型名如my_voice和采样率32k/40k/48k点一键处理自动完成人声分离uvr5→ 切分 3.7s 小段 → 提取 F0 与 Hubert 特征选训练设备直接点开始训练。训练产物是logs/train/48k/my_voice_e{s}_s{步}.pth按轮次/步数滚动保存配套的.index索引在同一目录。v1 配置默认batch_size4、learning_rate1e-4见 configs/v1/48k.json显存不够时按显存GB÷2粗估 batch_size 下调。[!WARNING] 切分出来的小段里若有背景音乐、混响重、响度不一致的片段模型会学进这些缺陷。预处理后先抽查logs下的小段音频比调任何训练参数都管用。进阶调优值得动的参数只有这几个改之前记住原则一个参数一次只动一个听完再动下一个。参数位置默认作用与副作用index_rate推理界面0.0检索增强权重。调高音色更像但易出电流声0.5 是常见上限batch_size训练配置如 configs/v2/48k.json4越大显存越吃紧OOM 时先砍它其次再降采样率x_pad / x_query / x_center / x_maxconfigs/config.py 的device_config()按显存自动推理分块长度。手动调小省显存但太小会造成衔接断裂f0method推理/实时界面rmvpe五种可选rmvpe、fcpe、pm、harvest、crepe。harvest/crepe 慢pm/fcpe 快实时优先 pm/fcpe离线追求精度用 rmvpe采样率训练时选48k48k 音质最好显存或速度吃紧时降到 32k配置文件分 v1/v2 两代、按 32k/40k/48k 分档首次启动会从 configs/ 拷贝到configs/inuse/之后你改inuse/下的文件即生效。避坑手册症状 → 原因 → 解决症状常见原因解决办法启动报FileNotFoundError: *.pt预训练模型没下全重跑python tools/download_models.py确认assets/hubert/hubert_base.pt、assets/rmvpe/rmvpe.pt存在pip install中途报编译错误Python 版本不在 3.8或平台架构与依赖 wheel 不匹配确认python --version≥3.8AMD 换requirements-amd.txtIPEX 换requirements-ipex.txtCUDA out of memory训练batch_size 超过显存承受调小 batch_size显存 ≤4GB 时程序已自动放宽预处理步长仍不够就换 32k 配置CUDA out of memory推理分块参数过大调小 configs/config.py 中的 x_pad/x_query 等分块长度关其他占卡程序音频有杂音/失真源音频底噪大index_rate 过高先用 uvr5 人声分离再转index_rate 压到 0.5 以下音调忽高忽低、跑调F0 提取方法不匹配人声类型换 F0 方法试女声试 rmvpe实时试 pm/fcpe音调偏移别超过 ±12 半音实时变声有爆音系统音频设备缓冲不足换 WASAPI 独占或低延迟驱动设备输出加淡入淡出crossfade 默认 0.05s中文界面乱码/翻译缺失i18n 语言包未生效语言包在 i18n/locale/界面顶部可切换改动后重启更多细节可查 docs/cn/faq.md 和 docs/en/faq_en.md多语言文档齐备。最后说清能力边界RVC 的边界很清楚10 分钟数据出可用模型、N 卡上接近实时的批量转换、百毫秒级实时变声、支持 v1/v2 两代模型与 ONNX 导出tools/export_onnx.py。但它不解决源音频质量——底噪重的录音训出来也是底噪重的模型。遇到本文没覆盖的问题直接翻 docs/ 目录下的 FAQ 和各语言文档或在项目社区提 issue都写得比你想象得详细。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →