Whishper 本地音频转文字完整指南:前端、调度、引擎三组件全拆解

Whishper 本地音频转文字完整指南:前端、调度、引擎三组件全拆解 Whishper 本地音频转文字完整指南前端、调度、引擎三组件全拆解【免费下载链接】whishperTranscribe any audio to text, translate and edit subtitles 100% locally with a web UI. Powered by whisper models!项目地址: https://gitcode.com/gh_mirrors/wh/whishperWhishper 是一款开源的本地音频转文字工具把音频或视频文件上传上去就能转成文字需要的话再做翻译还能直接打开内置字幕编辑器逐条精修。整个过程都发生在你的电脑里不注册、不上传任何云端。如果你是播客主理人、字幕志愿者或者经常要处理会议录音它能省掉一堆在线工具的切换成本。这份指南会讲清楚它的三个组件各自怎么分工以及三步在本地把它跑起来的方法。 为什么音频处理要留在本地把音频丢给在线转录服务文件要经过网络、存到别人的服务器上。如果内容里有客户电话、内部讨论、私人对话这种交出去很难撤回即便是公开内容在线工具也常常带次数上限或按量收费处理得越多花得越多。Whishper 的做法很直接把整条流水线搬到你自己的机器上。底层的 Whisper 模型OpenAI 开源的一整套语音识别模型在本地运行甚至完全断网也能工作。它默认采用 FasterWhisper 引擎——Whisper 的加速实现在 CPU 上速度明显更快如果你手上有 NVIDIA 显卡速度还能再上一档。隐私不妥协、费用为零、速度快这三点就是本地方案的核心价值。Whishper 的三个工位前端、调度、引擎各管什么可以把 Whishper 想象成一座小工厂。接待前台是 Svelte 搭建的 Web 前端你在这里提交文件、选参数、看结果。调度员是 Go 写的后端服务接住每个请求把任务状态记进数据库再把音频转交给生产车间。生产车间就是 Python 写的转录服务Whisper 模型在这里真正加载并干活语音变成文字。图Whishper 的品牌视觉transcribe、translate、subtitle 正是它的三大核心功能转录、翻译、字幕。三个主工位之外还有几位配角LibreTranslate 负责翻译MongoDB 负责保存所有转录记录Nginx 负责把整套服务收敛到同一个访问地址。它们由部署脚本自动拉起平时不用你操心。一段音频的完整旅程从上传到字幕回显第 1 步你在浏览器页面上传音频文件选择源语言、目标语言可选和模型大小点下开始。第 2 步前端把请求发给 Go 后端。后端先在 MongoDB 里写一条任务记录之后你随时能看到进度。第 3 步后端把音频转交给 Python 转录服务。服务先把音频解码成波形再交给 Whisper 模型逐句输出带时间戳的文字。第 4 步如果你选了翻译目标语言文本会送进 LibreTranslate 做翻译没选就跳过这一步。第 5 步结果返回后后端通过 WebSocket浏览器与服务端之间的实时推送通道把最新状态推给页面进度条实时跳动不用手动刷新。第 6 步文字出来后你可以直接下载 SRT、VTT、TXT 或 JSON也可以打开字幕编辑器调整分句、拆分片段系统还会对读速过快CPS的字幕条给出提醒。技术栈速览核心代码都藏在哪儿三个组件分住在三个目录里边界清晰前端Svelte 工程位于frontend/界面组件集中在frontend/src/lib/components/下转录表单、字幕编辑器、下载弹窗各自是一个组件文件。后端Go 工程位于backend/backend/api/server.go负责启动 HTTP 服务并注册路由backend/api/handlers.go是各类请求的处理函数集合。转录服务Python 工程位于transcription-api/transcription-api/transcribe.py是核心转录逻辑transcription-api/backends/fasterwhisper.py封装了 FasterWhisper 后端。想翻源码的话按前台、调度、车间这个对应关系找目录几分钟就能定位到想看的部分。三步跑起来Whishper 本地部署指引第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/wh/whishper第 2 步进入项目目录参考example.env和README.md的说明配置好环境变量。第 3 步一条命令拉起全部服务cd whishper docker-compose up -d容器启动后打开浏览器访问本地地址界面加载出来就可以上传第一段音频了。收尾它适合谁还能期待什么经常处理会议、讲座、播客且内容敏感的人整个流程留在本地音频文件不出你的机器隐私是硬指标。做字幕和翻译的人内置编辑器、CPS 读速提醒、多种格式导出一套界面完成原本要换好几个工具才能做的事。硬件条件不一的人没有显卡也能用 CPU 跑有 NVIDIA GPU 则能享受更快的转录速度。如果你正想找一款本地音频转文字工具这个 Whisper 开源项目值得动手一试——按上面的三步走今天就能跑起来。【免费下载链接】whishperTranscribe any audio to text, translate and edit subtitles 100% locally with a web UI. Powered by whisper models!项目地址: https://gitcode.com/gh_mirrors/wh/whishper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考