尧图精选

Faster Whisper:13 分钟录音 1 分 03 秒转完,INT8 把显存砍到 2.9GB

🕒 发布时间:2026/9/5 23:33:26 📁 来源:尧图网络
Faster Whisper13 分钟录音 1 分 03 秒转完INT8 把显存砍到 2.9GB【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper用原版 Whisper 转一条 13 分钟的会议录音GPU 上要跑 2 分 23 秒、显存占用 4.7GB换 faster-whisper 这套基于 CTranslate2 的转录引擎fp16 下只要 1 分 03 秒切到 int8 量化后显存降到 2.9GB识别准确率不变。下面直接说怎么装、怎么挑配置、哪些坑会咬人。一行 pip 装完十行代码出结果安装就一条命令不需要单独装 FFmpeg——音频解码由依赖里的 PyAV 库内置完成省掉了环境配置最常见的一步pip install faster-whisperfrom faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})模型按名字tiny到large-v3自动从 Hugging Face 下载 CTranslate2 格式的权重。想要词级时间戳就加word_timestampsTrue想跳过静音段加vad_filterTrue默认会过滤掉超过 2 秒的静默长音频收益明显。用官方基准看真实差距以下数据取自仓库 README 的基准测试GPU 环境为 RTX 3070 Ti CUDA 12.4跑 large-v2 模型转 13 分钟音频CPU 环境为 i7-12700K 开 8 线程跑 small 模型。GPUlarge-v2实现精度耗时显存openai/whisperfp162分23秒4.7GBfaster-whisperfp161分03秒4.5GBfaster-whisperint859秒2.9GBCPUsmall实现精度耗时内存openai/whisperfp326分58秒2.3GBfaster-whisperint81分42秒1.5GBGPU 上还能用批量推理把速度再压一档batch_size8时 large-v2 int8 只需 16 秒显存 4.5GB。纯 fp16 相比原版快 1.4 倍左右主要红利在 int8——速度快近 2.4 倍显存省 40% 以上README 称整体最高可达 4 倍。按硬件三句话定配置有 NVIDIA GPUdevicecudacompute_typefloat16显存紧张改int8_float16纯 CPUdevicecpucompute_typeint8比 fp32 快得多且省内存内存紧张或批量处理换更小的模型base/small或用BatchedInferencePipeline开批量转录它默认自带 VAD 过滤先踩这两个坑能少查半天segments是生成器transcribe返回后并不会立刻开跑必须list(segments)或进入 for 循环才真正开始转录。只拿到对象就打印会发现什么都没有。GPU 环境只认 CUDA 12 cuDNN 9最新的 ctranslate2 只支持这个组合。还在 CUDA 11 上的人把 ctranslate2 降到 3.24.0嫌麻烦可以直接用 Docker官方镜像是nvidia/cuda:12.3.2-cudnn9-runtime仓库里 docker/infer.py 给了完整的部署示例。改代码前先看仓库这两个位置想调转录参数beam size、VAD 阈值、语言检测等直接看 faster_whisper/transcribe.py 里WhisperModel的transcribe签名所有可选项都有注释。想复现或扩展上面的数字benchmark/ 目录下的speed_benchmark.py和wer_benchmark.py就是 README 里表格的出处。建议先用base模型 int8 把流程跑通确认输出格式符合预期再逐步升级到large-v3或批量推理避免一上来就在大模型上调参。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →