尧图精选

Amphion 预训练模型依赖全指南:从下载到离线部署的完整配置手册

🕒 发布时间:2026/10/2 1:58:41 📁 来源:尧图网络
音频语音媒体生成深度学习【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址https://gitcode.com/GitHub_Trending/am/Amphion点击查看免费下载本指南系统梳理 Amphion音频、音乐与语音生成工具包在推理、训练与评测流程中所依赖的全部预训练模型逐一给出官方下载来源、目标存放目录与最终文件结构并结合仓库源码说明这些模型在实际预处理与评测环节中的具体调用方式。读完本文你将能够一次性为 Amphion 搭建完整的预训练模型环境并掌握无外网环境下离线加载评测模型如 BERT、RoBERTa、BART、WavLM的完整解决方案。一、为什么需要预训练模型依赖Amphion 是一个支持可复现研究的音频、音乐与语音生成工具包其内部模块大量复用社区公认的预训练模型作为零件声码器VocoderBigVGAN、HiFi-GAN、DiffWave 负责把模型输出的声学特征如 Mel 谱还原为可听的波形内容特征提取器ContentVec、WeNet、Whisper 负责从参考音频中提取与说话人无关的内容表征是歌声转换SVC、语音转换VC等任务的关键前置步骤说话人相似度评测RawNet3、WavLM 用于客观评估生成音频与参考音频的说话人相似度客观评测指标FAD、CER/WER 等指标内部依赖 BERT 系模型与 Whisper用于计算距离与识别错误率。这些模型并非仓库内自带权重而是需要通过 pretrained/README.md 的指引手动下载并放置在约定的目录结构下。下表汇总了全部依赖按字母序类别模型用途声码器Amphion Singing BigVGAN歌声合成波形还原声码器Amphion Speech HiFi-GAN语音合成波形还原声码器Amphion DiffWave语音/歌声波形还原内容提取ContentVec内容特征legacy 500 类内容提取WeNet中文语音内容特征内容提取Whisper内容特征默认 medium 尺寸说话人相似度RawNet3说话人嵌入提取评测可选bert-base-uncased / facebook/bart-base / roberta-base / wavlmFAD 距离、CER/WER、说话人相似度下文按此分类逐一展开下载与部署细节。二、声码器类预训练模型Amphion 在 models/vocoders 下实现了 GAN 系列含 HiFi-GAN、BigVGAN、MelGAN 等生成器与扩散系列DiffWave声码器预训练权重可直接用于推理阶段。1. Amphion Singing BigVGAN官方 BigVGAN 模型被 Amphion 团队使用超过 120 小时歌声数据微调得到面向歌声合成的专用版本。模型下载地址为 Hugging Face 上的amphion/BigVGAN_singing_bigdata你需要下载其中的400000.pt与args.json两个文件放入Amphion/pretrained/bigvgan目录Amphion ┣ pretrained ┃ ┣ bigvgan ┃ ┃ ┣ 400000.pt ┃ ┃ ┣ args.json关于该权重的更多信息可参考 pretrained/bigvgan/README.md其中注明微调数据组合为VCTK LibriTTS LJSpeech。在源码侧models/vocoders/gan/generator/bigvgan.py 是 BigVGAN 生成器的实现models/vocoders/gan/gan_vocoder_trainer.py 与 models/vocoders/vocoder_inference.py 分别负责训练与推理时加载生成器args.json保存了训练时的超参数推理时用于恢复一致的模型配置因此两个文件必须同时存在、缺一不可。2. Amphion Speech HiFi-GANAmphion 团队使用685 小时语音数据训练了 HiFi-GAN 预训练模型下载地址为amphion/hifigan_speech_bigdata。与 BigVGAN 不同这里需要下载整个hifigan_speech文件夹并放入Amphion/pretrained/hifigan最终结构如下Amphion ┣ pretrained ┃ ┣ hifigan ┃ ┃ ┣ hifigan_speech ┃ ┃ ┃ ┣ log ┃ ┃ ┃ ┣ result ┃ ┃ ┃ ┣ checkpoint ┃ ┃ ┃ ┣ args.json其中log目录保存训练日志、result目录保存评测音频样例、checkpoint目录存放训练产生的各步检查点而args.json记录模型配置。参考 pretrained/hifigan/README.md该权重同样基于 VCTK LibriTTS LJSpeech 数据训练。注意目录命名差异BigVGAN 的目录名是bigvgan小写HiFi-GAN 的目录名是hifigan两者在 pretrained 目录下并列存放不要混淆。3. Amphion DiffWaveDiffWave 预训练模型使用125 小时语音数据与约 80 小时歌声数据训练下载地址为amphion/diffwave。需要下载整个diffwave文件夹到Amphion/pretrained/diffwaveAmphion ┣ pretrained ┃ ┣ diffwave ┃ ┃ ┣ diffwave_speech ┃ ┃ ┃ ┣ samples ┃ ┃ ┃ ┣ checkpoint ┃ ┃ ┃ ┣ args.jsondiffwave_speech子目录内samples存放生成样例checkpoint存放模型权重args.json存放训练配置。该模型在 egs/vocoder/diffusion 配方recipe中作为扩散声码器被调用权重目录结构同样由推理代码按约定路径加载。三、内容特征提取模型内容特征是歌声/语音转换任务中与说话人无关的核心表征。在 processors/content_extractor.py 中Amphion 实现了三类内容提取器其extractor_type限定为whisper、contentvec、wenet三者之一assert self.extractor_type in [whisper, contentvec, wenet]下面依次说明三个模型的下载与配置方式。1. ContentVecContentVec 用于提取音素级内容表征。请从官方仓库下载ContentVec_legacy版本、500 类的检查点对应文件名为checkpoint_best_legacy_500.pt放入Amphion/pretrained/contentvecAmphion ┣ pretrained ┃ ┣ contentvec ┃ ┃ ┣ checkpoint_best_legacy_500.pt在预处理配置中该文件路径通过contentvec_file字段指定。以 egs/svc/DiffComoSVC/exp_config.json 为例extract_contentvec_feature: true, contentvec_batch_size: 1, contentvec_file: pretrained/contentvec/checkpoint_best_legacy_500.pt,源码侧ContentvecExtractor定义于 processors/content_extractor.py读取cfg.preprocess.contentvec_file加载检查点其内容特征维度由配置中的contentvec_dim指定该示例配置中为256帧移为contentvec_frameshift默认 20ms。2. WeNetWeNet 用于中文语音的内容特征提取。请从 WeNet 官方预训练模型列表下载wenetspeech检查点以wenetspeech_u2pp_conformer_exp为例解压并修正配置路径cd Amphion/pretrained/wenet ### 解压实验目录 tar -xvf wenetspeech_u2pp_conformer_exp.tar.gz ### 在 train.yaml 中指定更新后的路径 cd 20220506_u2pp_conformer_exp vim train.yaml # TODO: 将第 2 行的 cmvn_file 的值改为 global_cmvn 文件的绝对路径 # 例如: [YourPath]/Amphion/pretrained/wenet/20220506_u2pp_conformer_exp/global_cmvn其中cmvn_file指向的global_cmvn是 WeNet 推理所需的全局倒谱均值方差CMVN统计文件必须改为绝对路径否则加载train.yaml时无法定位该文件。解压并修改后的最终目录结构如下Amphion ┣ pretrained ┃ ┣ wenet ┃ ┃ ┣ 20220506_u2pp_conformer_exp ┃ ┃ ┃ ┣ final.pt ┃ ┃ ┃ ┣ global_cmvn ┃ ┃ ┃ ┣ train.yaml ┃ ┃ ┃ ┣ units.txt在配置中WeNet 的加载涉及两个字段同样见 egs/svc/DiffComoSVC/exp_config.jsonwenet_model_path: pretrained/wenet/20220506_u2pp_conformer_exp/final.pt, wenet_config: pretrained/wenet/20220506_u2pp_conformer_exp/train.yaml,源码侧processors/content_extractor.py 通过 modules/wenet_extractor/utils/init_model.py 的init_model与 modules/wenet_extractor/utils/checkpoint.py 的load_checkpoint完成模型初始化和权重加载并从train.yaml读取网络结构与 CMVN 路径。3. WhisperWhisper 同时承担内容特征提取与识别类评测CER/WER双重角色。Amphion 默认使用medium尺寸的 Whisper 模型官方权重可通过如下命令下载cd Amphion/pretrained mkdir whisper cd whisper wget https://openaipublic.azureedge.net/main/whisper/models/345ae4da62f9b3d59415adc60127b97c714f32e89e936602e85993674d08dcb1/medium.pt最终结构Amphion ┣ pretrained ┃ ┣ whisper ┃ ┃ ┣ medium.pt配置侧通过whisper_model_path指定权重位置whisper_model指定模型尺寸medium。源码中WhisperExtractor见 processors/content_extractor.py对路径的处理很灵活若whisper_model_path指向.pt文件则以其所在目录作为下载根目录若指向目录则直接作为下载根目录。加载时调用whisper.load_model(...)特征提取通过whisper.pad_or_trim与whisper.log_mel_spectrogram完成帧移由whisper_frameshift与whisper_downsample_rate共同决定。四、说话人相似度评测模型RawNet3说话人相似度是客观评测中衡量音色还原程度的关键指标。RawNet3 的官方检查点可从jungjee/RawNet3获取下载其中的model.pt文件并放入Amphion/pretrained/rawnet3Amphion ┣ pretrained ┃ ┣ rawnet3 ┃ ┃ ┣ model.pt在评测代码 evaluation/metrics/similarity/speaker_similarity.py 中model_name rawnet分支会按约定路径pretrained/rawnet3/model.pt加载权重并调用extract_rawnet_speaker_embd提取说话人嵌入。若该文件缺失说话人相似度指标将无法计算。五、可选评测管线模型的离线部署当使用 Amphion 的评测管线见 egs/metrics/README.md时若运行终端无法访问huggingface.co会触发类似OSError: Cant load tokenizer for ...的错误。解决方案是提前下载评测依赖模型并统一存放在Amphion/pretrained下再按 egs/metrics/README.md 的 Troubleshooting 章节配置环境以加载本地模型。评测管线的可选依赖如下按字母序模型存放位置用途bert-base-uncasedpretrained/bert-base-uncasedFAD 距离的 tokenizerfacebook/bart-basepretrained/facebook/bart-baseFAD 距离的 tokenizerroberta-basepretrained/roberta-baseFAD 距离的 tokenizerwavlmpretrained/wavlm说话人相似度特征提取1. bert-base-uncased从 Hugging Face 模型库下载bert-base-uncased的全部文件存放于Amphion/pretrained/bert-base-uncasedAmphion ┣ pretrained ┃ ┣ bert-base-uncased ┃ ┃ ┣ config.json ┃ ┃ ┣ coreml ┃ ┃ ┃ ┣ fill-mask ┃ ┃ ┃ ┣ float32_model.mlpackage ┃ ┃ ┃ ┣ Data ┃ ┃ ┃ ┣ com.apple.CoreML ┃ ┃ ┃ ┣ model.mlmodel ┃ ┃ ┣ flax_model.msgpack ┃ ┃ ┣ LICENSE ┃ ┃ ┣ model.onnx ┃ ┃ ┣ model.safetensors ┃ ┃ ┣ pytorch_model.bin ┃ ┃ ┣ README.md ┃ ┃ ┣ rust_model.ot ┃ ┃ ┣ tf_model.h5 ┃ ┃ ┣ tokenizer_config.json ┃ ┃ ┣ tokenizer.json ┃ ┃ ┣ vocab.txt其中config.json、tokenizer_config.json、tokenizer.json、vocab.txt是 tokenizer 正常加载的必要文件pytorch_model.bin或model.safetensors为模型权重其余格式CoreML、ONNX、Flax、TF、Rust可一并下载以保证目录完整。2. facebook/bart-base从 Hugging Face 下载facebook/bart-base全部文件存放于Amphion/pretrained/facebook/bart-base注意比其余模型多一层facebook父目录这与 HF 的模型命名空间保持一致Amphion ┣ pretrained ┃ ┣ facebook ┃ ┃ ┣ bart-base ┃ ┃ ┃ ┣ config.json ┃ ┃ ┃ ┣ flax_model.msgpack ┃ ┃ ┃ ┣ gitattributes.txt ┃ ┃ ┃ ┣ merges.txt ┃ ┃ ┃ ┣ model.safetensors ┃ ┃ ┃ ┣ pytorch_model.bin ┃ ┃ ┃ ┣ README.txt ┃ ┃ ┃ ┣ rust_model.ot ┃ ┃ ┃ ┣ tf_model.h5 ┃ ┃ ┃ ┣ tokenizer.json ┃ ┃ ┃ ┣ vocab.jsonBART 使用 BPE 词表因此需要vocab.json与merges.txt两个文件配合tokenizer.json才能完成分词。3. roberta-base从 Hugging Face 下载roberta-base全部文件存放于Amphion/pretrained/roberta-baseAmphion ┣ pretrained ┃ ┣ roberta-base ┃ ┃ ┣ config.json ┃ ┃ ┣ dict.txt ┃ ┃ ┣ flax_model.msgpack ┃ ┃ ┣ gitattributes.txt ┃ ┃ ┣ merges.txt ┃ ┃ ┣ model.safetensors ┃ ┃ ┣ pytorch_model.bin ┃ ┃ ┣ README.txt ┃ ┃ ┣ rust_model.ot ┃ ┃ ┣ tf_model.h5 ┃ ┃ ┣ tokenizer.json ┃ ┃ ┣ vocab.json与 BART 类似RoBERTa 也需要vocab.json、merges.txt额外的dict.txt是 RoBERTa 的词表统计文件。4. wavlmWavLMmicrosoft/wavlm-base-plus-sv用于说话人相似度评测其文件结构如下Amphion ┣ pretrained ┃ ┣ wavlm ┃ ┃ ┣ config.json ┃ ┃ ┣ preprocessor_config.json ┃ ┃ ┣ pytorch_model.bin在 evaluation/metrics/similarity/speaker_similarity.py 中model_name wavlm分支默认从microsoft/wavlm-base-plus-sv在线加载当配置了本地路径后则通过Wav2Vec2FeatureExtractor.from_pretrained(pretrained/wavlm, sampling_rate16000)与WavLMForXVector.from_pretrained(pretrained/wavlm)加载本地特征提取器与模型其中preprocessor_config.json记录了 16kHz 采样等预处理参数。5. 离线模型路径自动修正脚本下载完成后还需修正 FAD 计算所依赖的 tokenizer 路径。根据 egs/metrics/README.md 的 Troubleshooting 指引在Amphion/pretrained目录下创建如下 bash 脚本它会自动将laion_clap/training/data.py中的 tokenizer 加载路径改写为本地的绝对路径#!/bin/bash BERT_DIRbert-base-uncased ROBERTA_DIRroberta-base BART_DIRfacebook/bart-base PYTHON_SCRIPT[YOUR ENV PATH]/lib/python3.9/site-packages/laion_clap/training/data.py update_tokenizer_path() { local dir_name$1 local tokenizer_variable$2 local full_path if [ -d $dir_name ]; then full_path$(realpath $dir_name) if [ -f $PYTHON_SCRIPT ]; then sed -i s|${tokenizer_variable}.from_pretrained(\.*\)|${tokenizer_variable}.from_pretrained(\$full_path\)| $PYTHON_SCRIPT echo Updated ${tokenizer_variable} path to $full_path. else echo Error: The specified Python script does not exist. exit 1 fi else echo Error: The directory $dir_name does not exist in the current directory. exit 1 fi } update_tokenizer_path $BERT_DIR BertTokenizer update_tokenizer_path $ROBERTA_DIR RobertaTokenizer update_tokenizer_path $BART_DIR BartTokenizer echo BERT, BART and RoBERTa Python script paths have been updated.使用要点脚本默认针对lib/python3.9/site-packages/laion_clap/training/data.py若使用 conda可通过conda info --envs查询环境路径并替换[YOUR ENV PATH]若你的环境布局不同需手动修改PYTHON_SCRIPT变量使其正确指向实际的data.py运行脚本成功后三个 tokenizer 将改为加载本地模型FAD 指标即可离线计算。对于 WavLM 说话人相似度同样只需按上文目录放置模型即可实现离线加载无需额外脚本。六、部署自检清单完成全部下载后建议按如下清单核验声码器pretrained/bigvgan400000.ptargs.json、pretrained/hifigan/hifigan_speech含checkpoint与args.json、pretrained/diffwave/diffwave_speech含checkpoint与args.json内容提取pretrained/contentvec/checkpoint_best_legacy_500.pt、pretrained/wenet/20220506_u2pp_conformer_exp/final.ptglobal_cmvntrain.yamlunits.txt且train.yaml中cmvn_file为绝对路径、pretrained/whisper/medium.pt说话人相似度pretrained/rawnet3/model.pt评测离线模型可选pretrained/bert-base-uncased、pretrained/facebook/bart-base、pretrained/roberta-base、pretrained/wavlm四个目录齐全且 tokenizer 路径修正脚本已执行。上述路径与配置项均与仓库源码中的默认加载逻辑一一对应内容提取器读取contentvec_file、wenet_model_path、wenet_config、whisper_model_path见 processors/content_extractor.py 与 egs/svc/DiffComoSVC/exp_config.json说话人相似度评测按pretrained/rawnet3/model.pt与pretrained/wavlm加载见 evaluation/metrics/similarity/speaker_similarity.py评测管线依赖的离线模型详见 egs/metrics/README.md。按本文步骤部署完成后Amphion 的语音/歌声合成、转换与客观评测流程即可在完全本地、可复现的环境下运行。赞分享音频语音媒体生成深度学习【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址https://gitcode.com/GitHub_Trending/am/Amphion点击查看免费下载相关推荐GPT-SoVITS预训练模型完全指南从配置到部署GPT SoVITS预训练模型完全指南从配置到部署 模型体系概览 GPT SoVITS提供多版本预训练模型支持覆盖从基础到专业级应用需求。通过配置文件可查看语音音频人工智能大模型微调模型推理服务本地部署LibrePhotos 离线部署实战手动预置机器学习模型与关闭在线依赖的完整操作指南LibrePhotos 离线部署实战手动预置机器学习模型与关闭在线依赖的完整操作指南 本篇指南讲解如何让自托管的 LibrePhotos 在完全无网络的环境下后端前端移动开发计算机视觉机器学习终极指南Seafile离线环境依赖包手动部署完全手册终极指南Seafile离线环境依赖包手动部署完全手册 你是否在隔离网络中部署Seafile时遭遇依赖缺失的困境是否因无法连接外部仓库导致安装频频失败本文将存储数据同步上一篇如何5分钟快速上手智能发票处理工具InvoiceNet完整指南下一篇DeepTutor智能复习系统基于遗忘曲线的高效复习策略终极指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →