尧图精选

17秒转写13分钟音频:faster-whisper 快速上手指南

🕒 发布时间:2026/10/2 1:51:38 📁 来源:尧图网络
17秒转写13分钟音频faster-whisper 快速上手指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是基于 CTranslate2 推理引擎重写的 Whisper 语音识别实现同等准确率下最高比原版快 4 倍且更省内存。如果你要在产品里集成离线语音转文字或批量处理会议、播客录音看这篇即可跑起来并调好参数。速度与内存一张表faster-whisper 对比 openai/whisper官方基准13 分钟英文音频beam_size5给出的数据如下。GPU 数据为 large-v2 模型NVIDIA RTX 3070 TiCUDA 12.4部署成本指是否依赖系统级 FFmpeg实现速度转写 13 分钟音频显存/内存部署成本openai/whisperfp162m23s4708MB需系统安装 FFmpegwhisper.cppfp16Flash Attention1m05s4127MB需自行部署二进制faster-whisperfp161m03s4525MB无需 FFmpegPyAV 自带解码faster-whisperint859s2926MB无需 FFmpegfaster-whisperfp16batch_size817s6090MB无需 FFmpegCPU 侧差距同样明显small 模型上openai/whisperfp32要 6m58sfaster-whisper int8 只要 1m42s 且内存 1477MB加 batch_size8 可进一步压到 51s。完整测试脚本在仓库 benchmark/ 目录。三步装好并验证pip install 到第一条转写结果前置条件确认Python 3.9 及以上当前发布版本 1.2.1无需安装 FFmpeg音频解码由依赖库 PyAV 完成核心依赖 pip 自动装好ctranslate24.x、onnxruntime、av、tokenizers仅 GPU 需要NVIDIA 显卡 CUDA 12 cuBLAS cuDNN 9若停留在 CUDA 11 / cuDNN 8需降级ctranslate24.4.0第一步一条命令安装依赖自动解析pip install faster-whisper第二步验证版本python -c import faster_whisper; print(faster_whisper.__version__)终端打印出1.2.1即安装成功。第三步最小可运行代码CPU int8 量化转写仓库自带的测试音频from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(tests/data/jfk.flac, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})首次运行会先从 Hugging Face 下载一次 small 模型权重之后你会看到逐行带起止时间的输出形如[0.00s - 2.44s] And so my fellow Americans...。参数速查转写时最常改的 7 个开关完整签名和注释见 faster_whisper/transcribe.py 中的transcribe方法常用参数如下参数常用取值何时使用devicecpu / cuda有 NVIDIA 显卡选 cuda否则 cpucompute_typefloat16 / int8_float16 / int8GPU 首选 float16显存紧张用 int8_float16CPU 用 int8beam_size1–5默认 5值越小解码越快越大结果越稳定batch_size8 / 16长音频批量转写需配合 BatchedInferencePipelinevad_filterTrue默认开启转写前过滤静音段阈值经 vad_parameters 调整默认只移除超过 2 秒的静音word_timestampsTrue需要词级时间戳字幕对齐、热词定位languageen / zh 等已知语种时跳过自动检测速度更稳实战两个场景批量推理与 VAD 静音过滤 ⚡场景一长录音批量转写吃满 GPU。用BatchedInferencePipeline替代常规 transcribe它是即插即用的 drop-in 替换from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(modelmodel) segments, info pipeline.transcribe(audio.mp3, batch_size16)效果README 基准显示同一 GPU 上 large-v2 模型转写 13 分钟音频从 1m03s 降到 17sfp16batch_size8int8 下为 16s。场景二会议录音里大量沉默直接跳过。给 transcribe 传vad_filterTrue其实默认已开启并用vad_parameters收紧判定阈值segments, _ model.transcribe( meeting.mp3, vad_filterTrue, vad_parametersdict(min_silence_duration_ms500), )效果超过 500ms 的静音都会被切掉不再浪费算力在无语音片段上若还要逐词定位加word_timestampsTrue后从每个 segment 的words字段读取。避坑表5 个常见报错的对应修法现象可能原因解决办法加载 GPU 报 CUDA 相关错误缺 cuBLAS/cuDNN或 CUDA 11 环境配了新版 ctranslate2按 CUDA 12 装 cuBLAS 和 cuDNN 9旧环境降级pip install --force-reinstall ctranslate24.4.0GPU 显存不足OOM模型过大或 fp16 占用偏高compute_type 改用 int8_float16或换更小模型转写速度远低于预期CPU 上跑大模型或 beam_size 偏高换小模型 int8或换 GPU长音频走 batched 推理调用 transcribe 后一直没有输出segments 是生成器遍历前不会真正开始转写用 for 循环遍历或list(segments)强制执行首次运行特别慢首次会从 Hugging Face 下载模型权重等一次即可之后走本地缓存也可转换模型目录后直接加载下一步拿真实录音对比量化方案faster-whisper 解决的是 Whisper 推理慢、占内存高的问题int8 量化和批量推理在内存与吞吐上还有余量。建议下一步拿一段真实录音分别用 float16 和 int8 各跑一遍对比耗时、内存和识别差异再决定线上配置想复现本文基准数据可直接运行 benchmark/ 目录下的速度脚本想细看全部参数就翻 faster_whisper/transcribe.py。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →