开源圈的"字幕救星":这款本地转录工具,正在悄悄取代剪映自动字幕
老板开了个一小时的长会,临走时丢下一句:"帮我把会议内容整理一下。"
导师录了 90 分钟的网课,作业要求:"把核心要点提炼出来。"
记者做完 40 分钟的人物采访,回办公室才发现——还得把每一句话敲成文字。
回放、暂停、敲几个字、再倒回去听……原本 1 小时的录音,老老实实转写下来往往要花掉 3 到 4 个小时。这是几乎所有内容工作者都踩过的坑。
OpenAI 在 2022 年开源了一个叫 Whisper 的语音识别引擎,识别准确率几乎可以和专业速记员掰手腕。但问题在于:Whisper 本身只是一堆代码,对非程序员来说,就像把一台没有方向盘的法拉利塞进车库——动力再强,你也开不走。
正因如此,英国开发者 Chidi Williams 决定给 Whisper 套一个普通人也能直接上手的"外壳"。他把这个桌面程序取名为 Buzz——英文里是蜜蜂"嗡嗡叫"的声音,恰好对应"听懂声音"这件事。
Buzz 最核心的特点可以浓缩成一句话:所有运算都在你自己的电脑上完成,不连网、不上传、永久免费。
截至目前,Buzz 已经迭代到第 47 个版本,最新的 v1.4.4 发布于 2026 年 3 月,在 GitHub 上累计获得了 19.2k Star 和 1.4k Fork,是离线语音转写领域最受欢迎的开源项目之一。
一、Buzz 到底能做什么?
简单来说,Buzz 就是一个把"声音"变成"文字"的桌面应用。你把音频或视频丢进去,它会吐出整理好的文字稿。
| 功能 | 通俗解释 |
|---|---|
| 🎙️ 音视频转写 | 支持 mp3、mp4 文件,甚至可以直接粘贴 YouTube 链接 |
| 🔴 实时转录 | 一边录音一边出文字,类似现场演讲的"同传字幕" |
| 🌍 多语种翻译 | 英文录音可以直接生成中英对照文稿,覆盖近百种语言 |
| 👥 说话人分离 | 自动识别"这是 A 说的、那是 B 说的" |
| 🎚️ 降噪处理 | 嘈杂环境录音能先把人声从背景噪音中"挑"出来 |
| 📁 文件夹监听 | 把音频丢进指定文件夹,Buzz 自动开始转写 |
| 📄 多格式导出 | 支持 TXT 纯文本、SRT / VTT 字幕文件(可直接用于剪辑) |
和市面上同类产品最大的不同在于:
- ❌ 不是科大讯飞那种"录音必须上传到云端"的方案——你的素材全程留在本机;
- ❌ 不是 Otter.ai那种"按分钟数收费"的工具——完全免费,转 100 小时也是 0 元;
- ✅ 是一个真正跑在你电脑里的离线小工具,断网状态下照常工作。
二、手把手安装教程
Buzz 自带图形界面,完全不需要写一行代码。
第一步:选择适合你系统的安装方式
🪟 Windows 用户
- 前往 SourceForge 的 Buzz 下载页,下载 .exe 安装包;
- 双击运行,系统可能提示"未知发行者",点【更多信息】→【仍要运行】即可。
🍎 macOS 用户
方式一(推荐):打开终端执行:
brew install --cask buzz
方式二:在 SourceForge 下载 .dmg 文件,拖入"应用程序"文件夹。
🐧 Linux 用户
sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module
sudo snap install buzz
👨💻 极客路线(PyPI)
pip install buzz-captions
python -m buzz
第二步:选择 Whisper 模型
首次打开 Buzz 时,软件会让你挑选一个识别模型。模型越大 = 越准,但也越慢、越吃内存:
| 模型 | 内存占用 | 速度 | 准确率 | 适用人群 |
|---|---|---|---|---|
| Tiny | ~1 GB | 极快 | 一般 | 老旧电脑、快速预览 |
| Base | ~1 GB | 快 | 中等 | 日常对话 |
| Small | ~2 GB | 中等 | 较好 | 普通用户首选 |
| Medium | ~5 GB | 慢 | 高 | 重要会议、专业采访 |
| Large | ~10 GB | 很慢 | 最高 | 专业内容、多语种混合 |
第一次选定后,软件会自动下载模型文件(这一步需要联网)。下载完成后,之后再用就完全不需要网络了。
第三步:导入素材,开始转写
- 把音视频文件直接拖进 Buzz 窗口;
- 或者点 File Import 导入本地素材;
- 也可以点 URL Import 粘贴 YouTube 链接;
- 实时录音用 Live Recording。
进度条跑完,文字稿就生成了。点 Export 可以导出为 TXT 或 SRT 字幕文件,直接拖进剪映、Premiere 就能用。
三、软硬件门槛:我的电脑能跑吗?
Buzz 对硬件相当友好,因为它支持多种加速方案:
| 设备类型 | 能否运行 | 实际体验 |
|---|---|---|
| 普通 Windows 笔记本(无独显) | ✅ 可以 | 用 Tiny/Base 模型,1 小时录音约 5-15 分钟 |
| Nvidia 独显台式机 | ✅ 极速 | 支持 CUDA 加速,速度提升 5-10 倍 |
| M1 / M2 / M3 Mac | ✅ 极速 | Apple Silicon 原生优化,非常流畅 |
| Intel 老款 Mac | ✅ 可以 | 速度一般,建议用小模型 |
| Linux 桌面 | ✅ 可以 | 支持 Vulkan 加速,集成显卡也能用上 |
最低配置参考:
- 系统:Windows 10+ / macOS 11+ / Ubuntu 20.04+
- 内存:4 GB(用 Tiny/Base);8 GB+(用 Small 及以上)
- 硬盘:预留 5-10 GB 空间存放模型文件
- Python 版本(PyPI 方式):3.12
四、谁最该用 Buzz?
- 🎓 学生党:把老师课件录音转成文字笔记,或把英文公开课转成字幕再翻译,效率直接翻倍。
- 💼 上班族:开会时录音,会后丢进 Buzz 自动生成纪要草稿,微调一下就能发邮件,再也不用边开会边狂敲键盘。
- 🎬 自媒体 / Up 主:录完视频懒得手动加字幕?直接生成 SRT 文件,导入剪映、Pr 即用。
- 🎙️ 播客主:把节目音频转成文字稿发布到公众号、博客,让搜索引擎也能搜到你的节目。
- 🗞️ 记者 / 编辑:采访录音一键转文字稿,节省 80% 的整理时间。
- 🦻 听障人士的家人:给视频通话、电视节目实时生成字幕,让家中老人也能"看见"声音。
- ⚖️ 医生 / 律师 / 心理咨询师:咨询录音完全本地处理,不上传云端,满足隐私合规要求——这是 Buzz 相比商业云端产品最大的优势。
- 🌐 跨国团队成员:把外语会议录音自动翻译成英文文字稿,跨语言协作效率拉满。
五、项目地址
- GitHub 仓库:https://github.com/chidiwilliams/buzz