Buzz 本地语音识别指南:用 Whisper 离线完成音频转文字
Buzz 本地语音识别指南用 Whisper 离线完成音频转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz假设手头有一段两小时的访谈录音你不想把它上传给任何在线服务。这时 Buzz 可以派上用场它是基于 OpenAI Whisper 的本地语音识别工具把音频转文字和翻译的完整流程放在你的电脑上完成数据不离开本机。它和在线语音识别差在哪同一份录音走云端和走本地差别集中在这四点维度在线语音识别服务Buzz 离线转录数据流向音频上传到第三方服务器文件只在本机读写网络要求断网即不可用首次下载模型后断网可运行文件限制常有大小、时长上限仅受本地磁盘和内存约束费用按量计费或订阅无 API 调用费动手之前先看看你的机器Buzz 的 PyPI 版本需要 Python 3.12 环境并安装 ffmpeg图形版则开箱即用Windows 支持 CUDA 加速macOS 支持 Apple SiliconWhisper.cpp 后端还可用 Vulkan 调用核显。模型档位与硬件的对应关系大致如下模型档位模型体积硬件建议Tiny / Base约 75~140 MB任意近几年的 CPU 即可Small约 460 MB8 GB 内存更从容Medium约 1.5 GB建议独显CUDA 或 VulkanLarge约 2.9 GB强烈建议 NVIDIA GPU如果你的配置偏低建议从 Tiny 或 Base 档起步先跑通流程再考虑换大模型。装好它并跑通第一次转录四种安装渠道对比渠道适用对象安装方式Windows普通用户从 SourceForge 下载安装包未签名弹窗时选更多信息→仍要运行macOS普通用户下载.dmg双击安装Linux普通用户flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzzPyPI开发者见下方代码块pip install buzz-captions python -m buzz第一次转录按四步走导入按CtrlO选择本地音频/视频文件也可以导入 YouTube 链接CtrlU。配置在弹窗里选模型档位、转录语言和后端。知道音频语言时建议直接指定原因见下文。运行点击运行主界面任务队列里可以看到每个任务的状态与进度。查看与导出转录完成后打开任务左侧播放音频、右侧逐段高亮文本可搜索CtrlF、可调播放速度然后导出 TXT、SRT、VTT 格式。按任务类型选工作流单文件补转导入文件后除了导出你还可以在时间轴里精修结果——用CtrlLeft/CtrlRight微调片段起止时间配合CtrlP播放核对上下文Buzz 还支持说话人识别帮你区分不同发言者。完整快捷键定义在 buzz/settings/shortcut.py。整批文件自动处理在偏好设置的 Folder Watch 选项里填入一个监控目录Buzz 会自动转录新落入的音频文件输出格式和模型参数可以预设好。它还提供命令行接口方便写脚本把转录接进自己的流水线。会议实时录音按CtrlR打开录音窗口从麦克风实时转写可按语速调整延迟配套的演示窗口以全屏方式展示文字适合演讲或会议现场投影。模型档位与语言参数怎么选常见误区是模型越大越好Large 档准确率高但耗时和显存占用都远超 Base 档。按场景对号入座更省事你的场景建议档位实时转录、低配置机器Tiny日常会议、讲座追求平衡Base重要会议、需要反复核对Medium学术级精度、有 NVIDIA GPULarge语言参数方面自动检测靠开头几秒判断遇到方言、口音或中英混说容易选错一旦语言选错整段结果的标点、分句甚至用词都会跟着跑偏。所以建议只要你知道音频语言就在转录前显式指定混用语言时按占比最大的语言设置。谁适合用谁可以先不装适合装 Buzz 的读者处理含隐私内容的录音客户访谈、内部会议需要数据留在本机经常在弱网或离线环境工作不想被云服务卡住一次要处理几十甚至上百个文件的批量字幕制作想省掉按分钟计费的 API 开销可以先不装的读者音频文件都很小且没有隐私顾虑在线服务的精度体验已经够用没有 GPU、又依赖 Large 档精度本地跑起来会非常慢只需要转完就走不需要时间轴编辑、说话人识别这些本地化能力结语Buzz 把 Whisper 的能力搬进本地隐私数据不出机器、断网可用、没有按量费用这三点它都替你兜住了。如果你有一台近几年的电脑建议先装图形版用导入文件→跑一次 Tiny 档转录十分钟体验单文件补转流程跑通后再按前面的档位表为日常场景选定模型。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →