尧图精选

Buzz:百种语言的本地语音转文字,音频不出你的设备

🕒 发布时间:2026/9/10 8:45:52 📁 来源:尧图网络
Buzz百种语言的本地语音转文字音频不出你的设备【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz下午刚开完两小时的部门例会你需要在下班前把录音变成可编辑的文字稿但录音还躺在电脑里而网上的转录工具要你注册、上传、订阅。Buzz 就是为这种情况准备的它基于 OpenAI 的 Whisper 模型做离线转录所有转写都在你的本地电脑上完成免费不依赖网络。Buzz 的官方横幅左上角是应用图标右侧标注其基于 Whisper 的离线定位。它能做什么功能速览文件转写把音频、视频文件或网页链接丢进去Buzz 会用 Whisper 模型转成文字。结果支持导出为 TXT、SRT、VTT 三种格式纯文稿和字幕一次都能拿到。实时转写接上麦克风即可边说边出文字还带一个专门的展示窗口开会、做报告时可以直接投屏。翻译转录任务之外还有翻译任务。外语音频可以不先转成原文而是直接输出目标语言的文字一步到位。批量处理设置一个监控文件夹后新放进来的文件会自动排队转录适合攒了一堆待整理录音的情况。格式兼容常见的 MP3、WAV、M4A、MP4 等格式都能读视频文件也不用先手动抽音轨。插件扩展内置插件系统提供了 AI 摘要、说话人识别、字幕自动重排等能力插件位于 plugins/ 目录装完按需启用。Buzz 使用方法三分钟跑通第一个任务第一步安装。macOS 和 Windows 用户到官方发布页下载对应安装程序双击安装即可Linux 可以走 Flatpak 或 Snap。Python 环境用户则安装命令行版本需先装好 ffmpegPython 3.12pip install buzz-captions # 安装 Buzz python -m buzz # 启动应用第二步导入并配置。打开主界面用顶部工具栏的文件导入按钮选中录音然后在任务行里选择模型和输出格式。模型首次使用会自动下载之后一直缓存在本地。左侧为待处理的任务队列中间是转录状态与进度右侧预览转录片段。第三步执行。双击任务开始转写进度条实时更新多个文件会依次排队处理。第四步校对并导出。转完点开转录查看器可以搜索文字、拖动音频位置、调整播放速度逐句核对。TXT、SRT 或 VTT 文件会按设置生成在导出目录导出文件名模板可以在 settings/settings.py 中查看默认规则。转录查看器左侧为音频播放器右侧逐段显示带时间戳的文字可直接编辑。第五步可选用命令行跑。习惯终端的话一条命令就能完成转录python -m buzz add 会议录音.mp3 -s medium -l zh --txt # 中文、medium 模型、输出纯文本各参数含义可参考 buzz/cli.py 里的选项定义。不同场景不同用法会议记录输入一段两小时的例会录音说话人语速正常、背景干净。处理选 base 或 medium 模型语言一栏明确指定如中文避免自动检测跑偏输出勾选 SRT 保留时间戳。输出一份可按时间跳转的纪要底稿找某位同事在 40 分钟处提到的排期这类信息不再靠反复倒带。播客与视频字幕输入一整期节目的 MP4 文件直接导入即可无需先抽音轨。处理转写完成后用字幕重排工具按标点和间隔把长句切开控制每条字幕的长度。输出能直接上传到视频平台的 SRT 或 VTT 字幕文件。字幕重排面板按固定间隔或标点把过长的字幕行拆分参数在右侧调整。外语学习笔记输入一集外语课程音频或一段新闻播报。处理任务类型选翻译指定目标语言为中文Buzz 会把语音直接转成中文文字。输出对照着原音频的中文文稿生词和句型可以逐句回听定位。Whisper 本地部署选对模型速度翻倍Whisper 家族从 Tiny 到 Large 共五个量级越大越准也越吃资源。按机器配置对号入座即可模型推荐场景大致内存占用速度体感Tiny快速粗稿、实时转写1GB最快Base日常会议、随手录音~1GB快Small音频清晰、想更准一点~2GB中等Medium正式文稿、字幕制作~5GB较慢Large对准确率要求最高~10GB最慢 内存不够时先用 base 跑通流程需要精修的部分再单独用大模型重转。硬件加速方面NVIDIA 显卡走 CUDAMac 用 Apple Silicon其他独立显卡或集显可以在 Whisper.cpp 后端上启用 Vulkan这几项都在模型偏好里勾选。模型偏好页面列出各 Whisper 模型与文件大小首次选择时自动下载。离线音频转录常见问题与解决点不开应用提示缺少组件→ 多半是 ffmpeg 或系统运行库没装。先装好 ffmpeg 再启动Windows 上若报运行时缺失补装 Visual C 运行库。Linux 上装不上→ 命令行依赖多走 Flatpak 最省事flatpak install flathub io.github.chidiwilliams.Buzz依赖会一并打包。模型下载到一半失败→ 网络问题。手动把对应尺寸的 .bin 模型文件放进模型缓存目录默认在用户目录下的.cache/Buzz/models/再重新选择该模型。转写特别慢→ 模型选大了或者没吃到 GPU。降到 base 及以下或确认 CUDA / Vulkan 已启用。专有名词识别错→ 这是 Whisper 的通病。可以在初始提示词里给出背景如这是一场关于 Kubernetes 的技术会议转完再在查看器里人工修正。数据去哪了录音、模型和生成文稿全程保存在你自己的磁盘上转写是纯本地推理音频不会发给任何服务器。唯一会联网的动作是首次下载模型除非你主动配置了云端翻译 API否则 Buzz 的工作过程不依赖网络。有积压的录音待处理的话拿一段小音频试跑一遍三分钟就能看到第一份文字稿。想读源码或提 issuegit clone仓库地址https://gitcode.com/GitHub_Trending/buz/buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →