尧图精选

Chatterbox TTS:用 10 秒录音做出 23 种语言的声音克隆,完整讲清楚

🕒 发布时间:2026/9/5 21:11:37 📁 来源:尧图网络
Chatterbox TTS用 10 秒录音做出 23 种语言的声音克隆完整讲清楚【免费下载链接】chatterboxSoTA open-source TTS项目地址: https://gitcode.com/GitHub_Trending/chatterbox7/chatterbox给它一段 10 秒的录音这个声音马上就能开口说中文、法语、日语。这就是 ChatterboxResemble AI 开源的文本转语音TTS模型无需训练、无需配音演员只要一块显卡甚至纯 CPU就能开始做多说话人对话、视频解说和助手配音。认识 Chatterbox一个家族三档模型Chatterbox 不是一个模型而是一族Multilingual V3 约 5 亿参数支持 23 种以上语言比上一版说话人相似度更高、乱说话的情况更少Turbo 约 3.5 亿参数主打低延迟英文语音交互原生支持[laugh]、[chuckle]这类副语言标签Nano 只有 1.1 亿参数能在 CPU 上跑8 核机器上约为实时速度的 3 倍。所有生成的音频都会隐式写入 Perth 水印可用来追溯音频是否由模型生成。整个项目免费开源适合需要做角色配音、多语言解说或语音助手的开发者和内容创作者。三步装好并生成第一段语音安装一条命令装好依赖版本在pyproject.toml中已固定。想改代码或依赖时可从 https://gitcode.com/GitHub_Trending/chatterbox7/chatterbox 拉取源码进入目录后执行pip install -e .。pip install chatterbox-tts加载模型并生成import torchaudio as ta from chatterbox.mtl_tts import ChatterboxMultilingualTTS model ChatterboxMultilingualTTS.from_pretrained(devicecuda, t3_modelv3) wav model.generate(你好今天天气真不错。, language_idzh, audio_prompt_pathref.wav) ta.save(out.wav, wav, model.sr)听结果device可填cuda、mps或cpulanguage_id指定目标语言audio_prompt_path传入参考录音即可启用声音克隆模型权重首次运行会自动下载。拆解四个核心能力零样本声音克隆一段录音换一个声音能做什么不训练、不微调直接用别人的声音说新文本。怎么做把一段录音路径传给generate的audio_prompt_path模型内部会自动提取说话人特征。效果说话人音色和口癖基本保留参考音频建议选 510 秒、安静清晰的片段。适合给游戏角色一人一份录音做全套台词。23 种语言自由切换一个声音说多种话能做什么同一个声音克隆体说法语、中文、日语等 23 种以上语言。怎么做generate时传对应的language_id如fr、zh。效果V3 版本针对跨语言场景优化音色和口音的稳定性比 V2 更好。适合做本地化视频解说或多语言有声内容。情感强度可调平静到夸张之间滑动能做什么控制语音的情绪表现力。怎么做exaggeration管情绪强弱同时会让语速变快cfg_weight管多贴参考音色数值越低越自由。效果两个参数配合就能从平稳播报滑到夸张表演适合广告配音这类需要戏剧张力的场景。低延迟与 CPU 部署没有显卡也能跑能做什么在资源紧张的环境里实时出声。怎么做用ChatterboxTurboTTS加载 Turbo加nanoTrue换成 Nanodevice直接写cpu。效果解码步骤从 10 步压缩到 1 步Turbo 的算力与显存占用低于老模型Nano 面向端侧和 CPU 推理。适合实时语音助手和电话客服这类对延迟敏感的应用。此外还有一项独立能力语音转换。ChatterboxVC的generate接收原始音频和目标音色路径能把一段已有录音换声成目标说话人的声音适合给旧素材重新配音。按场景选参数对照表与三个常见坑场景推荐值说明通用合成exaggeration0.5cfg_weight0.5默认配置多数语言和提示词下表现均衡参考人语速偏快cfg_weight≈0.3降低对参考节奏的跟随语速更自然戏剧化、夸张表达cfg_weight≈0.3exaggeration≥0.7exaggeration会加快语速调低cfg_weight可压回节奏参考音频与目标语言不一致cfg_weight0避免把参考音频的口音带进其他语言问合成其他语言时声音带着参考音频的口音怎么办 答让参考录音的语言和language_id一致确实需要跨语言克隆时把cfg_weight设为0。问生成的语音语速忽快忽慢、听感不稳 答多半是exaggeration调太高导致语速被推快把它降回 0.5 左右再用cfg_weight微调节奏。问显存不够或者干脆没有 GPU 答换成 Turbo 或 NanonanoTruedevice填cpu架构相同且解码只走一步速度差距可接受。从示例脚本开始你的第一条合成Chatterbox 把多说话人、多语言、可调节情绪三件事打包进了一个 pip 可装的开源项目从一段录音到成品音频之间只剩几行代码。下一步建议先运行 example_tts.py 跑通英文和多语言合成再打开 example_vc.py 试试set_target_voice与语音转换example_tts_turbo.py 则能演示副语言标签的用法。【免费下载链接】chatterboxSoTA open-source TTS项目地址: https://gitcode.com/GitHub_Trending/chatterbox7/chatterbox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →