Buzz 离线语音转录完全指南:5 分钟从装好到导出字幕
Buzz 离线语音转录完全指南5 分钟从装好到导出字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz昨天一份两小时的播客音频递到我手上今天要交 SRT 字幕。录音含客户信息不能上传任何在线服务。我打开了 Buzz——一款桌面离线语音转录工具识别全在本地完成音频不离开设备最后拿到的是文本和字幕。项目定位速览Buzz 是什么它是什么开源桌面音频转录/翻译工具核心是 OpenAI 开源的 Whisper 语音识别模型把声音变成文字的耳朵解决什么完全离线地转录和翻译音频不上传、不按分钟计费、断网也能干活适合谁有隐私要求的用户法务、医疗、HR、要赶字幕的创作者、批量处理音频的人最大亮点5 种后端可选Whisper、Whisper.cpp、Faster Whisper、Hugging Face、OpenAI APINvidia 卡有 CUDA 加速Mac 有 Apple Silicon 支持核显可走 Vulkan覆盖面Windows / macOS / Linux 三端图形界面 命令行都有还带插件系统 安装并启动 Buzz 离线转录按系统选最短路径macOS从官方渠道下载 .dmg 安装包双击安装Windows从官方渠道获取安装程序程序未签名遇到警告选更多信息→仍要运行Linux一条 flatpak 命令即可io.github.chidiwilliams.Buzz也可用 snap 安装PyPI / 源码需 Python 3.12并先装好 ffmpeg然后pip install buzz-captions python -m buzz首次使用点导入媒体文件选一段音频任务选转录模型随便选一个小的点运行。模型会在首次使用时自动下载之后可在偏好设置的模型页统一管理。 实测 Buzz 离线语音转录的 4 项核心能力把一批本地音频文件丢进转录队列功能一次导入多个文件任务队列按顺序处理每行状态可见。实际效果睡前排好队醒来文本都在。Whisper.cpp 后端对低配机器友好核显也能通过 Vulkan 加速。代码在哪各引擎实现分布在 buzz/transcriber/Whisper.cpp、Faster Whisper 各自一个文件想换引擎不用改代码。实时录音并用独立窗口展示字幕功能选好麦克风和任务后点录制录制中可打开演示窗口Presentation Window。实际效果会议或讲座现场用独立窗口投屏实时字幕上墙省掉人工记笔记实时文本还可边生成边导出为 txt 文件方便接 OBS 等工具。代码在哪演示窗口逻辑在 presentation_window.py实时转录后端在 transcriber 目录的 recording_transcriber.py。编辑转录结果导出 TXT / SRT / VTT功能双击任务行打开转录查看器支持搜索、播放、变速转录完成后还能做说话人识别。实际效果把听错的专名改对再一键导出省掉手动整理说话人识别会为每句话标注发言人并允许你把标签改成真实姓名前提是原始音频文件还在磁盘上。代码在哪查看器组件在 buzz/widgets/transcription_viewer/说话人识别逻辑在其中的 speaker_identification_widget.py。用内置插件降噪、自动摘要功能菜单帮助 → 插件里可开关 6 个内置插件AI 摘要、增强语言检测、DOCX 导出、转录自动重排、DeepFilterNet 降噪、跳过已转录文件。实际效果转录前先降噪嘈杂录音的准确率能救一救转录完自动出摘要重复导入文件夹时已完成的文件直接跳过省算力。代码在哪buzz/plugins/每个插件一个独立目录可拖拽调整执行顺序。 复现两个典型工作流从视频文件生成 SRT 字幕步骤 1导入视频文件在高级选项中勾选 Word-Level Timings词级时间戳每个词单独计时。步骤 2转录完成后双击打开查看器点Resize按钮设置字幕单行最大长度、是否按标点断句。步骤 3导出 SRT。原始音频还在系统上时工具会顺带分析静音段校正边界少调很多行。用命令行无声批量转录步骤 1按上一节用 PyPI 装好 Buzz确认 ffmpeg 可用。步骤 2跑一条命令--hide-gui会隐藏图形界面适合服务器或脚本环境buzz add --model-type whispercpp --model-size small --language zh --srt --vtt --hide-gui ./interview.mp4步骤 3结束后输出目录里出现 SRT 和 VTT 文件。全部参数含义见 buzz/cli.py 中的定义模型类型、语言码、提示词都可指定。⚙️ 按硬件选模型与调参模型大小直接决定速度/精度取舍硬件情况建议模型建议后端核显 CPU、8GB 内存tiny / baseWhisper.cpp16GB 内存 中端 GPUsmall / mediumFaster Whisper / Whisper.cpp32GB 内存 RTX 显卡largeWhisper.cpp / Hugging Face三个常用进阶设置环境变量详见 docs/docs/preferences.mdBUZZ_WHISPERCPP_N_THREADS816 线程笔记本上调到 8 线程实测提速约 15%BUZZ_REDUCE_GPU_MEMORYtrue8 位量化省显存Whisper.cpp 也可选 q5 量化模型BUZZ_FORCE_CPUtrueGPU 老旧或有毛病时强制走 CPU偏好设置里的默认导出文件名支持{{input_file_name}}、{{task}}、{{date_time}}等变量拼模板批量跑完不会文件名打架。它不适合什么① 需要对外提供高并发转录接口——Buzz 是桌面应用不是服务② Intel 版 Mac 想用说话人识别——该平台不可用③ 追求极低延迟的追加并纠错直播模式——该模式资源消耗高硬件没余量别开。❓ 离线转录常见问题解答Q模型要手动下载吗不用。首次使用时自动下载也可以在偏好设置的模型页提前下载、删除旧模型。Q支持哪些语言中文能转录吗语言列表约 100 种含 zh中文、yue粤语、en、ja 等。建议明确指定语言而不是自动检测结果更稳。Q断网还能用吗核心转录与翻译完全离线。只有 OpenAI API 后端和 AI 摘要插件需要联网并提供密钥。QWindows 安装报警告怎么办程序未签名导致的点更多信息→仍要运行即可。Q说话人识别有前提条件吗原始音频文件需仍在系统上Intel macOS 上不可用。Buzz 是本地音频的离线干活的工具文件不出设备功能从单文件转录一路覆盖到批量自动化MIT 协议、完全免费。如需源码git clone 地址https://gitcode.com/GitHub_Trending/buz/buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →