快还是准?insanely fast whisper 语音转文字双模型完整选型指南
快还是准insanely fast whisper 语音转文字双模型完整选型指南【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper做语音转文字时insanely fast whisper 里最纠结的一步就是选 large-v3 还是 distil-large-v2。3 分钟读完直接拿到结论和能跑的命令。结论先行要精度选 large-v3要速度选 distil-large-v2。这组 large-v3 vs distil-large-v2 的取舍本质是拿约 1/4 的语言覆盖 一点精度余量换约 20% 的提速值不值取决于你的音频类型。两个模型的差异速览150 分钟音频A100 80GB 实测维度large-v3CLI 默认distil-large-v2模型体积3.09G1.55B 参数1.2B 参数少约 22%转录速度fp16 batching Flash Attention 2~98 秒~78 秒快约 20%语言覆盖约 99 种语言24 种语言转录精度最强多语言 / 低音质音频表现最稳英文干净录音基本持平多语言 / 低信噪比下下降硬件要求NVIDIA GPU 或 Mac mpsMac 建议--batch-size 4约占 12GB 显存同左显存压力略低速度数据来自项目 README 的 A100 基准。distil 版的提速来自参数量从 1.55B 压到 1.2B代价是语言砍到 24 种、精度余量变小。三个问题定选型问题1音频里有专业术语、多语言混合或低音质吗选 large-v3。蒸馏版是非英语和嘈杂场景下的精度下降最明显法律转录、学术讲座、多语言访谈这类任务全参模型更稳。问题2每天要处理几小时音频速度比最后那点精度更重要吗选 distil-large-v2。A100 上 150 分钟约 78 秒跑完比 large-v3 的 98 秒快 20 秒左右批量处理英文播客、会议纪要、讲座录音时吞吐差异会随数据量放大。问题3你跑在什么硬件上8GB 显存的卡或 Macmps 后端吃显存建议--batch-size 4distil-large-v2更小的模型更省资源。4090 / A100 这类显存充足的卡两者都行加上--flash True启用 Flash Attention 2 才拿得到上表的 98 秒 / 78 秒。一条命令快速上手核心代码在 src/insanely_fast_whisper/参数定义见 src/insanely_fast_whisper/cli.py。先安装pipx install insanely-fast-whisperlarge-v3默认模型加--flash True解锁完整速度pipx run insanely-fast-whisper --file-name ted_60.wav \ --model-name openai/whisper-large-v3 --flash Truedistil-large-v2 只换--model-namepipx run insanely-fast-whisper --file-name ted_60.wav \ --model-name distil-whisper/large-v2 --flash True结果默认写入output.jsonColab 复现示例见 insanely_fast_whisper_colab.ipynb更多可玩参数看 README.md。常见坑提示首次运行要下载 3.09G 模型网络慢可能超时直接重跑即可下载有缓存不会重下。Mac 上 OOMmps 后端不如 CUDA 省内存报显存不足就带--device-id mps --batch-size 4。--language别乱填指定语言与实际不符会整段转录跑偏不确定就留空让 Whisper 自动检测。想再快一截下一篇讲--batch-size和 Flash Attention 2 的正确安装方式。【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →