公司一批内部访谈视频要转文字,安全规定是素材不许出内网,云端工具一个都用不了,最后落在 Whisper 上——开源、免费、本地跑,视频不上传。折腾了小半天把环境搭通,这篇按部署笔记的顺序记一遍:环境怎么装、命令怎么敲、常见报错怎么处理,最后附一张含在线方案的对比表。不算太 geek,跟着走能通。

为什么选 Whisper
免费离线的中文语音识别里,Whisper 是目前比较能打的一个:开源不要钱、识别全程在本机、输出自带标点、一次转写自动生成 txt / srt / vtt 多种格式。代价是它没有图形界面,得自己搭一次环境。好在搭通之后,日常用起来就是敲一行命令的事。
一、环境准备(三样东西)
动手前把这三样备齐,后面基本不会卡壳:
步骤一:装 Python 3.9 以上
Whisper 跑在 Python 里,版本别太老,3.9 以上稳妥。装完在终端敲 python --version 确认能正常返回版本号。Windows 安装时记得勾上"Add Python to PATH",省得后面找不到命令。

步骤二:装 ffmpeg(Whisper 靠它解音轨)
Whisper 要靠 ffmpeg 把视频里的声音抽出来,这一步没配好后面必报错。Windows 下载解压后,把里面的 bin 目录加进系统环境变量 PATH;Mac 直接用 brew install ffmpeg 一句搞定。装完敲 ffmpeg -version 验证一下。

步骤三:磁盘留几个 G 放模型
模型文件不小,small 几百 MB,large 能到几个 G,提前留出空间,别转到一半提示空间不足。

二、安装与第一次转写
步骤四:pip 一行装 whisper
环境齐了就装包,一行命令:pip install -U openai-whisper。它是开源包,联网正常安装即可,不用注册、不用破解。

步骤五:一行命令转写
转写命令也就一行:whisper 你的视频.mp4 --language zh --model small。language 设成 zh 是中文、标点更规整;model 先用 small。回车后第一次会自动下载 small 模型,下完就地开跑,跑完在同目录生成 .txt、.srt、.vtt 几份文件,不用你额外指定格式。

三、模型怎么挑
| 模型 | 体积 / 速度 | 建议场景 |
|---|---|---|
| tiny / base | 小、快 | 快速出草稿,错字偏多 |
| small | 均衡 | 普通话清晰素材的日常选择 |
| medium / large | 大、慢 | 口音重、术语多,且机器性能好时用 |
一句话:普通办公本、素材干净,small 就是甜点档;追准确率又有独显,再往 medium 或 large 上加。
四、踩过的几个坑
- 提示找不到 ffmpeg:多半是 PATH 没生效,重开一个终端窗口再跑;
- 模型下载慢或中断:网络问题,可以手动下模型文件放进缓存目录再跑;
- 显存不足报错:换小一档模型,或在命令后加 --device cpu 用 CPU 硬跑(会慢);
- 输出没标点:检查 --language 是不是漏写,或没设成 zh。

五、和其他免费方案对比
部署完顺手把手边几个方案拉平对比了一下,含在线的,方便一起选型:
| 方案 | 是否离线 | 门槛 | 产物 | 适合 |
|---|---|---|---|---|
| Whisper(本文) | 离线 | 装环境、命令行 | TXT、SRT、VTT | 涉密素材、要批量 |
| Buzz | 离线 | 低,图形界面 | TXT、SRT | 不想碰命令行的离线 |
| 剪映电脑版 | 在线 | 低 | SRT、字幕压制 | 素材要剪辑 |
| 提词匠(微信小程序) | 在线 | 低,免安装 | TXT、Word、SRT、复制 | 有网、图省事 |
六、嫌部署麻烦?留个在线备选
Whisper 好在可控,但也得认:环境要搭一次,对只是偶尔转一两个不敏感视频的人,性价比不高。如果你的素材不涉密、电脑也有网,真没必要为一次性需求折腾这一整套。这种时候我会直接开微信电脑版里的提词匠小程序当备选:搜索「提词匠」打开,首页点「常用工具」里的「视频转文字」,上传本地视频,一两分钟出整段分段文稿,一键复制,TXT、Word、SRT 都能导。
它需联网、一次传一个视频,但省掉了 Python、ffmpeg、模型下载这一整串前置——识别在云端跑,不占本机资源,也不用配环境。所以我的分工是:内网涉密素材老老实实上 Whisper,日常零散、有网的活儿丢给提词匠,两边不抢。

七、老手才会固定下来的习惯
环境搭通之后,真正省时间的是下面这几条,都是我自己踩过才固定下来的:
- 长视频先抽音频再转。先用 ffmpeg 把视频转成 16kHz 单声道 wav,再丢给 whisper,体积小、排队快,失败率也低。
- 同一批素材共用一个模型,别来回换。tiny 和 large 混着跑,校对标准会乱;日常统一 small,只有口音特别重的几段再开 medium。
- 专有名词用查找替换一次性清。Whisper 对生僻人名、产品名经常错成同音字,导出 txt 后在编辑器里全局替换,比对着原片逐句改快得多。
- 批量转写写个小脚本。文件夹里几十个视频,用 for 循环挨个敲 whisper 命令即可;Windows 用 PowerShell,Mac/Linux 用 bash,逻辑一样。

小结
Whisper 是免费离线视频转文字里的主力选择,small 模型在普通办公机上就能把日常干净素材跑到可用水平,部署一次、后续一行命令搞定。真嫌搭环境麻烦、素材又不敏感,就退一步用在线工具,别跟自己较劲。按"素材敏不敏感"这条线来选,是这一圈折腾下来最省事的判断标准。工具版本更新较快,模型与功能以官方当前说明为准。

519

被折叠的 条评论
为什么被折叠?



