让 whisper.cpp 跑在 CUDA 上:10 分钟音频几分钟转完

让 whisper.cpp 跑在 CUDA 上:10 分钟音频几分钟转完 让 whisper.cpp 跑在 CUDA 上10 分钟音频几分钟转完【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cppwhisper.cpp 是 OpenAI Whisper 语音识别模型的 C/C 移植版输入一个 WAV 文件输出带时间戳的文字。把它编译到 CUDA 上后模型矩阵运算交给 NVIDIA GPU长音频转写速度可以比纯 CPU 快数倍——例如 base.en 模型下原本约 0.3 倍实时速度的转写可以提到 5 倍以上。本文只讲一段路径从启用 CUDA 编译到选模型、跑通再到确认 GPU 真的在工作不含训练和多平台部署。先确认你的环境够不够用CUDA 支持只面向 NVIDIA 显卡需要两张清单都过关显卡支持 CUDA Compute Capability 3.5 及以上GTX 10 系及之后的卡基本都满足。软件CUDA Toolkit 已安装GCC 7.5 或更新版本。显存方面参考值是这样的4 GB 显存适合 tiny 模型8 GB 适合 basemedium 或 large-v3-turbo 需要 12 GB 起步。显存决定你能跑哪个模型这一步先心里有数。启用 CUDA 编译下载代码后配置时加上一个参数其余与默认构建相同cmake -B build -DGGML_CUDA1 cmake --build build -j --config Release-DGGML_CUDA1是唯一的区别编译产物会链接 cuBLAS 并使用 CUDA kernel 实现。仓库同时保留了 Vulkan 支持AMD 等显卡可以走那条路本文不展开。按显存选模型模型下载用仓库自带脚本sh ./models/download-ggml-model.sh base.en先定档位再定量化按显存对号入座4 GB 显存如 GTX 1050tiny磁盘 75 MiB。8 GB 显存如 RTX 2060base.en磁盘 142 MiB。12 GB 及以上medium1.5 GiB或 large-v3-turbo1.5 GiB精度更高且比完整 large 更省。完整型号清单和 SHA 校验值见 models/README.md。显存吃紧时换量化版名字带-q5_0后缀的是量化模型磁盘和显存占用明显更低。例如 large-v3 完整版占 2.9 GiB对应量化版 large-v3-q5_0 只要 1.1 GiBlarge-v3-turbo 量化后是 547 MiB。精度敏感的场合再回退到非量化版多数场景量化版够用。怎么确认 GPU 真的在工作用 whisper-cli 跑仓库自带的样例./build/bin/whisper-cli -m models/ggml-base.en.bin \ -f samples/jfk.wav -t 8-t 8指 CPU 线程数建议设为物理核心数的一半CUDA 编译下矩阵运算在 GPU 上执行CPU 线程主要承担前后处理开太多意义不大。验证 GPU 参与计算有两个办法运行中开一个终端执行nvidia-smi看显卡显存占用和利用率是否变化或者对同一条音频分别加--no-gpu和不加再各跑一遍对比耗时差距通常非常明显。编译报 CUDA 错误、显存不足时查什么找不到 ggml-cuda.h 或 nvcc按顺序核对三件事CUDA Toolkit 是否装完整、nvcc是否能直接执行、CMake 是否真的检测到了 CUDA。在终端里跑nvcc --version确认路径再看 CMake 配置输出里有没有 CUDA 后端条目确认环境后删掉 build 目录重新配置。推理时显存不够三步走换更小档位的模型同一档位换-q5_0量化版长音频拆成多段分别转写。下一步如果要把转写能力暴露成 HTTP 接口可以看 examples/server/它复用同一套推理代码通过/inference接口接收音频文件。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考