离线音频转录神器 Buzz:把录音一键变成文字的免费本地工具
你有没有遇到过这样的时刻:一场两小时的会议录音躺在手机里,你下定决心要整理成文字,却在打开播放器的第十分钟就放弃——因为手动听写实在太痛苦了。或者你是一名内容创作者,为了给视频配字幕,反复暂停、回放、打字,一个三分钟的视频能耗掉一下午。
如果把"听写"这件事交给电脑,会怎样?Buzz 就是这样一个答案:它是一款完全免费、开源的离线音频转录工具,基于 OpenAI 的 Whisper 模型,能在你自己的电脑上把音频、视频、甚至实时录音,一键转换成带时间戳的文字。最大的卖点在于"离线"二字——所有数据处理都在本地完成,你的会议纪要、采访内容不会上传到任何云端服务器,隐私有保障,还不花一分钱订阅费。
当录音堆满硬盘,你缺的不是时间,而是一个会听写的工具
先想想你手头有多少"吃灰"的音频:会议录音、线上讲座、播客访谈、老师的课堂实录、客户的语音需求……它们之所以一直被搁置,是因为"转文字"这件事太苦了。而用在线工具呢?要么收费昂贵,要么需要把敏感内容上传到别人的服务器,心里总不踏实。
Buzz 想解决的就是这两件事:转录的质量与速度,以及数据的归属权。它是 Whisper 的图形化封装,安装后无需联网即可工作,音频在本地处理完毕,直接生成你想要的文字稿。速度取决于你的硬件,但不需要为每一个字付费。
Buzz 是什么:一个住进你电脑的离线转写员
一句话概括:Buzz 是一款跨平台的本地音频转文字工具,支持 Windows、macOS 和 Linux。它能处理的不只是音频文件——视频、网页视频链接同样可以直接转写,还能把转录结果翻译成英文。
它的能力清单相当能打:
| 能力 | 具体表现 |
|---|---|
| 文件转录 | 导入音频/视频文件,批量处理,导出带时间戳的文字 |
| 实时录音 | 麦克风实时转写,会议现场边讲边出字 |
| 演示窗口 | 全屏大字显示实时转写,适合演讲、课堂场景 |
| 说话人识别 | 区分不同说话人,转写稿更接近会议纪要 |
| 语音分离 | 嘈杂音频先分离人声再转录,提升准确率 |
| 多格式导出 | TXT、SRT、VTT,兼容剪辑软件与文字处理 |
| 多模型后端 | Whisper、Whisper.cpp、Faster Whisper、Hugging Face 模型、OpenAI API |
| 自动化 | 文件夹监控、命令行接口、插件系统 |
无论你是学生、记者、客服,还是视频博主,都能在这张清单里找到对自己有用的那一项。
三分钟装好:Windows、macOS、Linux 全覆盖
Buzz 的安装方式很多,挑一种最适合你的即可。
桌面用户:Windows 和 macOS 用户直接下载对应平台的安装包(Windows 安装包未签名,安装时选择"更多信息 → 仍要运行"即可);Linux 用户推荐用 Flatpak 或 Snap 安装:
flatpak install flathub io.github.chidiwilliams.Buzz
sudo snap install buzz
喜欢用 Python 管理一切的用户:如果你已经安装了 Python 3.12 环境,可以这样装:
pip install buzz-captions
python -m buzz
提示:通过 PyPI 安装时,需要先装好 ffmpeg,否则无法解析音频文件。
安装完成后首次启动,界面是英文的。想换成中文?项目的语言包支持中文(zh_CN),按官方文档的本地化说明操作即可,配置项不多,很快就能上手。
第一次转录:把采访录音变成可编辑文字
安装好之后,我们走一遍最核心的流程:把一段音频转成文字。整个过程只需三步。
第一步,导入文件:点击工具栏上的"+"按钮,或使用快捷键 Ctrl/Cmd + O,选择一个音频或视频文件。
第二步,配置参数:在弹出窗口中,任务选择"Transcribe"(转录);语言建议手动选成"Chinese",因为自动检测有时会出意外;模型可以先选一个小的(比如 Base),验证流程跑通。
第三步,点击 Run:任务进入队列,状态会从 Queued → In Progress → Completed。等待进度条走完,双击任务行,就能打开转录结果查看器。
看上面的截图:每一行就是一个转录任务,文件名、所用模型、任务类型、实时状态一目了然,还支持删除和重新排列。首次使用时模型会自动下载,之后就是纯离线工作了。
进阶玩法:让转写真正为你服务
跑通第一个转录只是开始,Buzz 的价值藏在下面这些进阶功能里。
实时录音与演示窗口:会议记录不用再抄
连接麦克风,选择任务、语言和模型,点击 Record 按钮,Buzz 就会把你说的话实时转成文字。如果开启了"演示窗口",还可以在全屏状态下用大字显示转写内容——做分享、开讲座时,观众能直接看到实时字幕,非常方便。
注意:实时转录对性能要求高。文档建议优先使用 Whisper.cpp 后端,配合小型模型才能接近"边说边出字"的体验。
说话人识别:分清谁在发言
采访录音最头疼的是"这段是谁说的"。Buzz 支持在转写时进行说话人识别,生成的文字稿会标注不同发言者。虽然需要额外计算资源,但对于需要整理多人对话的用户来说,省下的核对时间远超等待成本。
转录查看器与字幕调整:让字幕更好读
转写结果打开后是一个带时间轴的文字编辑器,支持搜索、播放控制、倍速回放。你可以在编辑器里直接修改错字、微调时间点,然后导出。
更妙的是"调整字幕"功能:可以按最大时长设置目标字幕长度,按标点符号拆分长句,按时间间隙合并断句,一键让字幕读起来更顺畅。做视频字幕的创作者,这个功能能省下大量手工调整的时间。
文件夹监控与插件:把转写变成自动化流水线
Buzz 支持"文件夹监控":指定一个文件夹,只要新音频文件被放进去,它就会自动开始转录。批处理大量录音时,这是真正的效率神器。
此外,Buzz 的插件系统让它的能力可以扩展,比如自动生成内容摘要、一键导出 Word 文档、跳过已转写的文件等。安装插件后,工作流可以更贴合你的个人习惯。
模型怎么选?从 73MB 到 2.9GB 的选择题
Buzz 支持多种 Whisper 模型,选对模型是速度与准确率之间的平衡艺术。下面是各模型的体积参考(来自项目源码):
| 模型 | 体积 | 定位 |
|---|---|---|
| Tiny | 约 73MB | 极快,适合低配设备快速预览 |
| Base | 约 139MB | 速度与准确率的入门平衡点 |
| Small | 约 462MB | 日常使用的可靠选择 |
| Medium | 约 1.5GB | 高精度需求,适合学术研究 |
| Large / V2 / V3 | 约 2.9GB | 最佳准确率,多语言场景 |
| Large-v3-turbo | 约 1.6GB | 大模型的速度优化版 |
模型管理界面可以下载、删除模型,甚至粘贴自定义模型路径。初次使用建议从 Base 或 Small 开始,跑通流程后再根据结果决定是否升级。
除了模型大小,后端的选择同样重要:Whisper 是 OpenAI 原始实现,准确但吃资源;Whisper.cpp 是 C++ 优化版,任何品牌 GPU 都能用,也是 Mac 用户的最佳选择;Faster Whisper 在 N 卡(6GB 显存以上)上速度惊人;Hugging Face 后端则能挂载社区的各种语言定制模型。如果你的电脑有 N 卡,配置好 CUDA 后转写速度能提升数倍。
常见问题
Q:转录太慢怎么办? 换小模型,或者改用 Whisper.cpp 后端。有 N 卡的用户可以尝试 Faster Whisper 并开启 GPU 加速。
Q:准确率不理想? 优先手动指定音频语言;在"高级设置"里填写初始提示(Initial Prompt),把常见人名、专有名词、行业术语写进去,能明显减少拼写错误;环境允许时换用更大的模型。
Q:如何转写电脑正在播放的声音(如视频通话)? 需要配置虚拟声卡:macOS 用 BlackHole,Windows 用 VB-CABLE,Linux 用 PulseAudio 的路由工具,把系统声音送入 Buzz 的麦克风输入。
Q:模型下载到哪个目录? Linux 在 ~/.cache/Buzz,macOS 在 ~/Library/Caches/Buzz,Windows 在 %USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。也可以在"模型管理"里直接查看文件位置。
现在就开始,让每一段声音都变成文字资产
你不需要一次性掌握所有功能。建议今天的路线是:先安装 Buzz,找一段几分钟的录音转写试试手感;明天再尝试实时录音和文件夹监控;等习惯了,再研究模型选择与 GPU 加速。每多掌握一个功能,你处理音频的效率就上一个台阶。
本地音频转文字的路,Buzz 已经帮你铺好了。打开它,导入第一段录音,剩下的交给这个安静工作的"离线转写员"吧。
- 官方文档:docs/docs/index.md
- 使用指南:docs/docs/usage/
- 核心转写源码:buzz/transcriber/
- 设置模块:buzz/settings/
- 插件目录:buzz/plugins/
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考






