基于OpenAI的Whisper构建的高效语音识别模型：faster-whisper

原创

已于 2023-12-29 17:26:14 修改 · 1.7w 阅读

标签

#whisper #语音识别 #人工智能 #faster-whisper

于 2023-12-29 17:21:49 首次发布

faster-whisper是基于OpenAIWhisper的优化版本，利用CTranslate2提高速度和内存效率。它在保持准确性的同时，提升了处理速度，特别适合大规模语音数据处理。文章详细介绍了模型特点、性能对比、安装与使用方法，以及其在各种场景下的应用潜力。

1 faster-whisper介绍

faster-whisper是基于OpenAI的Whisper模型的高效实现，它利用CTranslate2，一个专为Transformer模型设计的快速推理引擎。这种实现不仅提高了语音识别的速度，还优化了内存使用效率。faster-whisper的核心优势在于其能够在保持原有模型准确度的同时，大幅提升处理速度，这使得它在处理大规模语音数据时更加高效。

项目地址：https://github.com/SYSTRAN/faster-whisper

1.1 whisper

OpenAI 的开源模型 whisper，可以执行 99 种语言的语音识别和文字转写。但是 whisper 模型占用计算资源多，命令行使用门槛高。whisper 模型本身还存在一些问题，例如模型幻听问题（大部分的类似于不断重复同一句话、无语音部分复读莫名内容等都是由于这个原因造成的）。要更好使用 whsiper 模型就需要能够准确调试模型参数。但 whisper 模型参数众多，且命令行使用对使用者有一定要求，而且只有 torch 版可以做到调整参数。使用 VAD 类工具也需要一定的动手能力。

1.2 faster-whisper

faster-whisper是具有完全的 whsiper 模型参数，且自带 VAD加持的 whisper 版本，该版本使用了 CTranslate2 来重新实现 whsiper 模型，CT2 对 transformer 类网络进行了优化，使模型推理效率更高。相比于 openai/whisper，该实现在相同准确性下速度提高了 4 倍以上，同时使用的内存更少。

所谓 VAD 即 Voice Activity Detection —— 声音活动检测，在语音信号处理中，例如语音增强，语音识别等领域有着非常重要的作用。它的作用是从一段语音（纯净或带噪）信号中标识出语音片段与非语音片段。在语音转写任务中，可以提前将语音和非语音部分分离出来，从而提升 whisper 网络识别速度，并减少模型幻听。

VAD地址：https://github.com/snakers4/silero-vad

1.3 性能对比

在性能方面，faster-whisper展现了显著的优势。例如，在使用Large-v2模型和GPU进行13分钟音频的转录测试中，faster-whisper仅需54秒，而原始Whisper模型需要4分30秒。这一显著的性能提升，意味着在实际应用中，faster-whisper能够更快地处理大量数据，特别是在需要实时或近实时语音识别的场景中。