Whisper本地视频转文字部署教程:离线转写与免费方案对比

公司一批内部访谈视频要转文字,安全规定是素材不许出内网,云端工具一个都用不了,最后落在 Whisper 上——开源、免费、本地跑,视频不上传。折腾了小半天把环境搭通,这篇按部署笔记的顺序记一遍:环境怎么装、命令怎么敲、常见报错怎么处理,最后附一张含在线方案的对比表。不算太 geek,跟着走能通。

封面图

为什么选 Whisper

免费离线的中文语音识别里,Whisper 是目前比较能打的一个:开源不要钱、识别全程在本机、输出自带标点、一次转写自动生成 txt / srt / vtt 多种格式。代价是它没有图形界面,得自己搭一次环境。好在搭通之后,日常用起来就是敲一行命令的事。

一、环境准备(三样东西)

动手前把这三样备齐,后面基本不会卡壳:

步骤一:装 Python 3.9 以上

Whisper 跑在 Python 里,版本别太老,3.9 以上稳妥。装完在终端敲 python --version 确认能正常返回版本号。Windows 安装时记得勾上"Add Python to PATH",省得后面找不到命令。

终端执行 python --version 返回 3.9+ 版本号的截图

步骤二:装 ffmpeg(Whisper 靠它解音轨)

Whisper 要靠 ffmpeg 把视频里的声音抽出来,这一步没配好后面必报错。Windows 下载解压后,把里面的 bin 目录加进系统环境变量 PATH;Mac 直接用 brew install ffmpeg 一句搞定。装完敲 ffmpeg -version 验证一下。

Windows 环境变量 PATH 里加入 ffmpeg/bin 的设置界面

步骤三:磁盘留几个 G 放模型

模型文件不小,small 几百 MB,large 能到几个 G,提前留出空间,别转到一半提示空间不足。

模型文件下载后所在的缓存目录及其占用大小

二、安装与第一次转写

步骤四:pip 一行装 whisper

环境齐了就装包,一行命令:pip install -U openai-whisper。它是开源包,联网正常安装即可,不用注册、不用破解。

pip install -U openai-whisper 安装成功的终端输出

步骤五:一行命令转写

转写命令也就一行:whisper 你的视频.mp4 --language zh --model small。language 设成 zh 是中文、标点更规整;model 先用 small。回车后第一次会自动下载 small 模型,下完就地开跑,跑完在同目录生成 .txt、.srt、.vtt 几份文件,不用你额外指定格式。

whisper 转写命令执行中的进度输出与生成的结果文件列表

三、模型怎么挑

模型体积 / 速度建议场景
tiny / base小、快快速出草稿,错字偏多
small均衡普通话清晰素材的日常选择
medium / large大、慢口音重、术语多,且机器性能好时用

一句话:普通办公本、素材干净,small 就是甜点档;追准确率又有独显,再往 medium 或 large 上加。

四、踩过的几个坑

  • 提示找不到 ffmpeg:多半是 PATH 没生效,重开一个终端窗口再跑;
  • 模型下载慢或中断:网络问题,可以手动下模型文件放进缓存目录再跑;
  • 显存不足报错:换小一档模型,或在命令后加 --device cpu 用 CPU 硬跑(会慢);
  • 输出没标点:检查 --language 是不是漏写,或没设成 zh。

ffmpeg 报错信息与解决后正常运行的对比

五、和其他免费方案对比

部署完顺手把手边几个方案拉平对比了一下,含在线的,方便一起选型:

方案是否离线门槛产物适合
Whisper(本文)离线装环境、命令行TXT、SRT、VTT涉密素材、要批量
Buzz离线低,图形界面TXT、SRT不想碰命令行的离线
剪映电脑版在线SRT、字幕压制素材要剪辑
提词匠(微信小程序)在线低,免安装TXT、Word、SRT、复制有网、图省事

六、嫌部署麻烦?留个在线备选

Whisper 好在可控,但也得认:环境要搭一次,对只是偶尔转一两个不敏感视频的人,性价比不高。如果你的素材不涉密、电脑也有网,真没必要为一次性需求折腾这一整套。这种时候我会直接开微信电脑版里的提词匠小程序当备选:搜索「提词匠」打开,首页点「常用工具」里的「视频转文字」,上传本地视频,一两分钟出整段分段文稿,一键复制,TXT、Word、SRT 都能导。

它需联网、一次传一个视频,但省掉了 Python、ffmpeg、模型下载这一整串前置——识别在云端跑,不占本机资源,也不用配环境。所以我的分工是:内网涉密素材老老实实上 Whisper,日常零散、有网的活儿丢给提词匠,两边不抢。

提词匠小程序「视频转文字」的上传与结果导出界面

七、老手才会固定下来的习惯

环境搭通之后,真正省时间的是下面这几条,都是我自己踩过才固定下来的:

  • 长视频先抽音频再转。先用 ffmpeg 把视频转成 16kHz 单声道 wav,再丢给 whisper,体积小、排队快,失败率也低。
  • 同一批素材共用一个模型,别来回换。tiny 和 large 混着跑,校对标准会乱;日常统一 small,只有口音特别重的几段再开 medium。
  • 专有名词用查找替换一次性清。Whisper 对生僻人名、产品名经常错成同音字,导出 txt 后在编辑器里全局替换,比对着原片逐句改快得多。
  • 批量转写写个小脚本。文件夹里几十个视频,用 for 循环挨个敲 whisper 命令即可;Windows 用 PowerShell,Mac/Linux 用 bash,逻辑一样。

ffmpeg 抽取 wav 的命令与 whisper 批量脚本示例并排展示

小结

Whisper 是免费离线视频转文字里的主力选择,small 模型在普通办公机上就能把日常干净素材跑到可用水平,部署一次、后续一行命令搞定。真嫌搭环境麻烦、素材又不敏感,就退一步用在线工具,别跟自己较劲。按"素材敏不敏感"这条线来选,是这一圈折腾下来最省事的判断标准。工具版本更新较快,模型与功能以官方当前说明为准。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值