Faster-Whisper 完整安装指南:三步让 Whisper 转录提速 4 倍

Faster-Whisper 完整安装指南:三步让 Whisper 转录提速 4 倍 Faster-Whisper 完整安装指南三步让 Whisper 转录提速 4 倍【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是 OpenAI Whisper 语音识别模型的高性能重实现底层推理引擎换成了 CTranslate2一个专门加速 Transformer 模型推理的引擎。官方基准显示同样精度下它比 openai/whisper 最高快 4 倍、占用的内存更少GPU 上转写 13 分钟音频large-v2 模型只要 1 分 03 秒。这篇文章带你用最少三步把它装起来再讲怎么用、怎么避坑。装前自检faster-whisper 的 CPU 与 GPU 要求装之前先花一分钟确认这些CPU 路线和 GPU 路线分开看CPU 路线门槛最低Python 3.9 及以上、多核 CPU、内存尽量大一些。跑 small 级别的模型日常使用足够。GPU 路线推荐NVIDIA GPU配 CUDA 12 和 cuDNN 9含 cuBLAS。注意最新版的 ctranslate2 只支持 CUDA 12 cuDNN 9 这一组合老环境要先看后面踩坑手册。一个好消息你不用自己装 FFmpeg依赖里的 PyAV 已把 FFmpeg 库打包带上了mp3、wav、flac 这些常见格式开箱即读。三步跑起来准备、安装、验证第一步准备虚拟环境python3 -m venv fw-env source fw-env/bin/activate先确认python3 --version输出 3.9 及以上。环境干净后后面出问题都容易排查。第二步安装pip install faster-whisperGPU 用户还需要补两个 NVIDIA 库pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*Linux 上要在启动 Python 前设置好LD_LIBRARY_PATH具体 export 命令见 README 的 GPU 一节。图省事的话也可以用官方 CUDA Docker 镜像nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04库都预装好了。第三步验证安装 ✅在终端执行这条内联命令python -c import faster_whisper; print(faster_whisper.__version__)只要打印出版本号、没有红色报错就说明安装成功了。第一个转录示例先体验一次成功随便准备一个音频下面记作audio.mp3新建脚本from faster_whisper import WhisperModel model WhisperModel(tiny, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3, beam_size5) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})逐句说清楚tiny是最小的模型首次使用会自动从 Hugging Face Hub 下载并缓存到本地devicecpu加compute_typeint88 位量化是省内存组合普通笔记本就能跑transcribe返回两样东西——segments是分段结果info里带着自动检测的语言和置信度。运行后你会看到类似[0.00s - 2.31s] And so my fellow Americans这样的输出每行是起止时间加转写文本。能跑出这几行字后面都是锦上添花。进阶玩法词级时间戳、VAD 过滤、批量加速词级时间戳——做字幕对齐、逐词高亮都要用加一个参数即可segments, _ model.transcribe(audio.mp3, word_timestampsTrue)拿到后遍历seg.words每个词都有独立的start和end。VAD 静音过滤——内置的 Silero VAD 能把没人说话的部分直接裁掉调用时加vad_filterTrue就行。默认策略比较保守只过滤超过 2 秒的静音想更激进入口是vad_parametersdict(min_silence_duration_ms500)各参数的默认值都写在 faster_whisper/vad.py 里。批量推理——官方 GPU 基准里large-v2 转写 13 分钟音频普通 fp16 要 1 分 03 秒换成BatchedInferencePipeline并设batch_size8后只要 17 秒不想多占显存就用 int8 单批59 秒、显存从约 4.5GB 降到约 2.9GB。BatchedInferencePipeline.transcribe可直接替换WhisperModel.transcribe接口不变。更多转写选项可以看 faster_whisper/transcribe.py 里的参数定义。踩坑手册faster-whisper 安装失败怎么办现象加载模型时报 cuDNN 找不到、CUDA 版本不匹配。原因最新版 ctranslate2 只支持 CUDA 12 cuDNN 9你的环境是 CUDA 12 cuDNN 8 或 CUDA 11 cuDNN 8。解法降级 ctranslate2pip install --force-reinstall ctranslate24.4.0如果是 CUDA 11 cuDNN 8 的组合把版本号换成3.24.0。现象transcribe调用后立刻返回感觉什么都没发生。原因segments是生成器真正的转写发生在你迭代它的时候。解法包一层list(segments)或者像上面示例那样 for 循环打印跑完循环才算干完活。现象medium、large-v3 这类大模型直接爆内存、加载失败。原因默认精度吃显存。解法compute_type改成 CPU 的int8或 GPU 的int8_float16显存/内存占用能砍掉三成以上再不行就换小一档模型。现象自己测出的 CPU 速度和官方基准差很远。原因线程数和 beam 数没对齐——本库默认beam_size5而 openai/whisper 默认是 1条件不同结果自然不可比。解法跑对比脚本时先用OMP_NUM_THREADS4 python3 my_script.py固定线程数再谈速度。写在最后典型的用法就三类会议录音、播客的批量转字幕逐词时间戳给剪辑做对齐以及作为后端接进 WhisperX 之类的工具链。建议你现在就用 tiny 模型把「第一个转录示例」跑一遍跑通后再把模型换成large-v3加 int8直观感受一次速度和质量的差异。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考