GPT-SoVITS 语音克隆:如何用免费 GPU 在 Colab 上完成全流程训练
GPT-SoVITS 语音克隆如何用免费 GPU 在 Colab 上完成全流程训练【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个少样本语音克隆项目1 分钟人声数据就能训出一个可用的 TTS 音色而 Colab 免费 GPU 足够支撑整条训练链路全程零成本。看完这篇你可以在 1~2 小时内从录音做到一个能上线试听的可定制音色。为什么把训练放云端本地显卡的显存和硬盘两头卡脖子而 Colab 免费档把这两项都兜住了你只需要准备录音文件。这篇文章适合你如果你手里有几分钟到几十分钟的干净录音想把它变成可合成的音色不想在本地折腾驱动、CUDA 和依赖版本想顺带摸清数据加工 → 训练 → 推理这套 TTS 标准流程路线图五个阶段各拿到什么阶段做什么交付物预估耗时一 · 准备核对硬件与录音素材一份达标的输入清单10 分钟二 · 环境克隆代码、建 conda、装依赖可用的训练环境30~60 分钟三 · 权重与数据拿权重、加工数据切片 标注 特征张量60~90 分钟四 · 训练S1、S2 各训一遍GPT 与 SoVITS 两版权重30~120 分钟五 · 消费试听、批量合成、导出成品音频 / 可部署模型20 分钟阶段一 · 准备语音克隆的资源底线项目要求不满足怎么办GPU 显存≥8 GB把训练批大小减半再开训见高频问答磁盘空间≥15 GB清掉用不上的预训练权重与中间产物内存≥12 GBColab 免费档一般够用不够就换更高档机型录音素材≥1 分钟干净人声带底噪的先走阶段三的降噪步骤阶段二 · 环境免费 GPU 环境一次搭好共三步顺序执行。任何一步挂了先看报错最后五行。第 1 步拿到全部训练代码。git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS判定目录下出现GPT_SoVITS/和tools/。第 2 步建一个隔离的 Python 3.10 环境。隔离是为了不和别的 Notebook 的依赖互相打架。conda create -n GPTSoVITS python3.10 -y conda activate GPTSoVITS判定python --version打印 3.10.x。若容器里还没有 conda先装 miniforge 再回来。第 3 步一条脚本装依赖 拉基础权重。--device按机器 CUDA 选脚本支持 CU126 / CU128 / MPS / CPU--source HF走 Hugging Face国内网络不稳可改 ModelScope--download-uvr5顺带装人声分离模型后面处理带 BGM 的录音用得上。bash install.sh --device CU126 --source HF --download-uvr5判定GPT_SoVITS/pretrained_models/里能看到模型文件环境即通。阶段三 · 权重与数据拿到音色原料权重获取两个渠道一句话对比安装脚本已把基础预训练模型拉回来。想直接用别人微调好的音色就把 GPT 权重.ckpt放进GPT_weights/、SoVITS 权重.pth放进SoVITS_weights/WebUI 下拉框会自动出现。两个渠道差别只在站点Hugging Face 的社区音色最全ModelScope 国内网络更稳且链接走 resolve 路径而非 blob。数据加工五连从长录音到张量人声分离录音带 BGM 才需要tools/uvr5/webui.py 把人声单独抠出来。降噪tools/cmd-denoise.py 去底噪输出目录里是处理后的音频。切片tools/slice_audio.py 按静音点切成 3~10 秒小段切太碎浪费信息、太长占显存。标注格式文件名|文本一行一条存成.txt。标注质量直接决定发音质量这条值得慢慢听、慢慢写 ⚠️特征提取WebUI 里文本分词 / 语音自监督特征 / 语义 Token三步依次调用 GPT_SoVITS/prepare_datasets/1-get-text.py、2-get-hubert-wav32k.py、3-get-semantic.py把文本和音频转成模型能吃的张量。阶段四 · 训练零成本音色微调S1 与 S2 各一遍GPT 和 SoVITS 两个模型要各训一轮。先 S1GPT 侧文本→语义习惯命令行可以直接起python GPT_SoVITS/s1_train.py -c GPT_SoVITS/configs/s1longer.yaml判定日志目录里持续生成 ckptloss 平稳下降。默认配置 GPT_SoVITS/configs/s1longer.yaml 里epochs: 20、batch_size: 8就是新手友好值显存够就别动。S2SoVITS 侧走 GPT_SoVITS/s2_train.py配置基准是 GPT_SoVITS/configs/s2.json。不走 WebUI 时要自己保证配置文件里的train_semantic_path、train_phoneme_path、output_dir指向阶段三产出的目录。参数含义batch_size是每次并行处理几条句子砍半则训练时间约翻倍但显存宽裕epochs是数据完整过几遍太少欠拟合、太多音色容易过。loss 怎么算正常整体一路往下、短期抖动都正常中途反弹或出现 NaN先回头查标注别急着调参。阶段五 · 消费WebUI 试听、命令行批量、导出部署WebUI 试听最省心手动调试用浏览器点几下就出音频。export is_shareTrue python webui.py判定终端给出公网链接选刚训的两版权重上传参考音频、填参考文本和目标文本即可生成。命令行批量合成脚本化生产GPT_SoVITS/inference_cli.py 的文本必须走文件核心参数四个一组。python GPT_SoVITS/inference_cli.py --gpt_model x.ckpt --sovits_model x.pth \ --ref_audio ref.wav --ref_text ref.txt --ref_language 中文 \ --target_text target.txt --target_language 中文 --output_path out/判定输出目录里出现output.wav。导出部署脱离 PyTorchTorchScript 用 GPT_SoVITS/export_torch_script.py--gpt_model/--sovits_model/--ref_audio/--ref_text/--output_path五个参数必填ONNX 用 GPT_SoVITS/onnx_export.py它默认读文件里写死的示例路径需改成你自己的权重产物落在onnx/目录。高频问答OOM、断连与读错字症状训练中途 OOM。原因显存装不下当前批大小。修复批大小降到 4 甚至 2 重开S2 阶段可打开grad_ckpt用计算换显存。症状Colab 会话断开训练中断。原因会话重置把训练进程杀了。修复重连后先激活同一个 conda 环境GPT_SoVITS/s1_train.py 启动时会自动找实验目录里最新的 ckpt重新执行同一条命令即从断点续训。症状中文个别字读错、声调怪。原因标注错字、多音字或词典没命中。修复先改标注仍不对的在内置词典 GPT_SoVITS/text/chinese.py 里补词条再重跑一次特征提取。症状WebUI 下拉框里没有刚训的权重。原因文件没放在约定目录。修复.ckpt进GPT_weights/、.pth进SoVITS_weights/刷新页面即现。收尾把这套流程复制下去回顾路线克隆 → 环境 → 权重 → 数据五连 → 双模型训练 → 推理导出每一环都有独立脚本卡在哪段修哪段即可。接下来可以试三个方向换更长的录音素材对比音色稳定性的变化固定其他参数跑两组不同epochs的对照实验把导出后的 ONNX / TorchScript 模型挂进自己的应用里【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →