如何本地部署 VoxCPM2 语音合成:从安装到声音克隆的完整步骤
如何本地部署 VoxCPM2 语音合成从安装到声音克隆的完整步骤【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPMVoxCPM2 是一个开源的 Tokenizer-Free 语音合成系统支持 30 种语言的文本转语音、音色设计与声音克隆可直接输出 48kHz 音频。本文按安装 → 首次合成 → 按需扩展 → 解决卡点 → 微调的任务流推进每一步都给出实际命令和预期输出。 安装依赖先装运行时再决定是否需要克隆仓库这一步完成环境准备结束后得到一个可用的voxcpmPython 包以及按需一份本地仓库代码。运行时通过 pip 安装即可不需要从源码编译pip install voxcpm环境要求Python ≥ 3.10 且 3.13PyTorch ≥ 2.5.0NVIDIA GPU 需要 CUDA ≥ 12.0MacApple Silicon走 MPS 后端纯 CPU 也能跑但速度明显下降。VoxCPM2 的显存占用约 8 GB。只做语音合成的话安装到此为止模型权重会在首次运行时自动下载。如果要微调、或想直接使用仓库里的示例参考音频需要克隆仓库git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM仓库中scripts/是训练入口、conf/存放各版本的训练配置、examples/reference_speaker.wav是一段可复用的参考音频。 首次运行合成第一条 48kHz 语音这一步跑通最短的音色设计命令成功后会在当前目录生成可直接播放的demo.wav。voxcpm design \ --text 你好欢迎体验 VoxCPM2。 \ --output demo.wav首次运行会自动从 Hugging Face 下载openbmb/VoxCPM2权重终端先打印Loading VoxCPM model...完成后最后一行形如Saved audio to: demo.wav (3.62s)采样率为 48000 Hz。等价的 Python API 写法适合嵌进自己的脚本from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate( text你好欢迎体验 VoxCPM2。, cfg_value2.0, # 引导强度推荐 1.0–3.0 inference_timesteps10, # 扩散步数越小越快 seed42, # 固定随机种子可复现结果 ) sf.write(demo.wav, wav, model.tts_model.sample_rate)VoxCPM2 不把音频切成离散 token而是用扩散自回归架构直接生成连续声学表征流程为 LocEnc → TSLM → RALM → LocDiT 四阶段最后由 AudioVAE V2 解码出 48kHz 音频 按需扩展音色设计、可控克隆与极致克隆这一步根据手头素材选择合成模式三种模式共用同一套生成参数--cfg-value、--inference-timesteps、--seed只是输入不同。模式命令需要的输入适用场景音色设计voxcpm design文本可选--control描述用文字描述凭空创建新音色无需参考音频可控克隆voxcpm clone --reference-audio一段参考音频克隆音色可用描述再调语速、情绪极致克隆voxcpm clone --prompt-audio --prompt-text参考音频 其逐字转写模型从参考音频续写还原度最高# 音色设计用自然语言描述指定音色 voxcpm design \ --text 欢迎收听本期节目。 \ --control 年轻女声温暖温柔略带微笑 \ --output design.wav # 可控克隆仓库自带参考音频可直接使用 voxcpm clone \ --text 这是一个声音克隆演示。 \ --reference-audio examples/reference_speaker.wav \ --output clone.wav批量与长文本有两个配套能力批量生成文本一行一条输出按output_001.wav顺序编号可叠加任意克隆参数。voxcpm batch --input texts.txt --output-dir outs \ --reference-audio examples/reference_speaker.wav词/字级时间戳先安装pip install voxcpm[timestamps]再给命令追加--timestamps --timestamp-level char --timestamp-language zh音频旁会生成同名.timestamps.json。不想写代码也可以起浏览器页面python app.py --port 8808 --device auto然后打开http://localhost:8808。--device支持auto、cpu、mps、cuda和cuda:NMac 上auto会优先使用 MPS。 解决常见卡点下载、设备与参数首次运行的问题基本集中在模型下载、设备选择和参数调整三处。模型下载慢或超时。国内网络可先用 ModelScope 把权重拉到本地目录未安装则先pip install modelscope再改本地加载from modelscope import snapshot_download snapshot_download(OpenBMB/VoxCPM2, local_dir./pretrained_models/VoxCPM2) model VoxCPM.from_pretrained(./pretrained_models/VoxCPM2, load_denoiserFalse)CLI 端则用--model-path ./pretrained_models/VoxCPM2指向同一目录。显存不够或设备报错。--device指定运行设备显存吃紧时追加--no-denoiser跳过降噪模型加载。仍装不下就换小一号的版本VoxCPM2VoxCPM1.5VoxCPM-0.5B参数量2B0.6B0.5B语言30 种 9 种中文方言中英中英输出采样率48kHz44.1kHz16kHz音色设计 / 可控克隆支持——显存~8 GB~6 GB~5 GBVoxCPM1 系列1.5 / 0.5B与 VoxCPM2 同源都是 TSLM RALM LocDiT 结构区别在于后两者的下游模块和克隆能力生成效果不稳定。三个主要调参点--cfg-value默认 2.0调高更贴描述、过高易偏音--inference-timesteps默认 104–30 之间是速度与质量的平衡区加--seed可固定随机性。官方也说明音色设计与可控克隆的结果在多次生成间会有差异建议生成 1–3 次取最佳。环境配置或权重加载卡住时可以找仓库 README 中给出的飞书群入口和维护者交流⚙️ 进阶用 5 分钟音频做 LoRA 微调这一步把模型适配到特定说话人、语言或领域完成后得到一组可热加载的 LoRA 权重。官方说法是 5–10 分钟干净音频即可开始。先准备数据每行一个 JSONaudio是路径、text是转写文本duration可选{audio: speakers/a.wav, text: 对应的转写文本。, duration: 3.5}训练前先校验数据有问题的样本会被报告校验不通过时命令以非零码退出voxcpm validate --manifest train.jsonl --sample-rate 16000conf/voxcpm_v2/下的 YAML 里是占位路径pretrained_path、train_manifest、save_path把配置文件复制到仓库外再填真实路径然后启动训练python scripts/train_voxcpm_finetune.py \ --config_path ./my_finetune_lora.yamlLoRA 微调基于voxcpm_finetune_lora.yaml默认 r32、alpha32全参数微调对应voxcpm_finetune_all.yaml。仓库还提供训练 WebUIpython lora_ft_webui.py后打开http://localhost:7860。训练出的 LoRA 权重可以直接挂到前面任何一条命令上voxcpm design --text 用微调后的音色说这句话。 \ --lora-path ./checkpoints/finetune_lora \ --output ft_demo.wav两点边界提醒声音克隆只能用于自己有使用权限的音色禁止用于冒充他人或欺诈AI 生成内容建议明确标注项目基于 Apache-2.0 协议发布可商用生产部署前建议针对具体场景做测试与安全评估。到这里从环境到微调的完整链路已经跑通。下一步建议从成本最低的动作开始给voxcpm design加一句不同的--control描述各生成一次对比音色差异熟悉参数后再上批量生成最后用真实录音数据做第一次 LoRA 微调。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →