免费不限时长语音转文字:Whisper电脑端从零部署教程,附手机端、网页端平替方案 - 软件盘点管家

免费不限时长语音转文字:Whisper电脑端从零部署教程,附手机端、网页端平替方案 - 软件盘点管家

语音转文字的工具试了一圈,最后都绕不开同一个问题:免费额度不够用。在线工具按分钟收费,APP 要开会员,一场三小时的会议录音转下来,费用比请人听写便宜不了多少。真正"免费且不限时长"的方案,目前就一个:OpenAI 开源的 Whisper 模型,装在自己电脑上,想转多少转多少。这篇教程从零开始,把 Whisper 的部署到出稿完整走一遍,电脑配置不够、或者只转小文件的,文末也给了手机端和网页端的平替方案——日常单条小文件,我自己其实更多用提词匠这类小程序随手转,Whisper 留给大活。

封面图

开始前:先确认你的电脑够不够格

Whisper 对配置有要求,先对照自查:

  • 系统:Windows、macOS、Linux 都支持
  • 内存:8GB 起步,用 medium 以上模型建议 16GB
  • 硬盘:留出 5GB 以上空间装环境和模型
  • 显卡:不是必需。有 NVIDIA 显卡速度快很多,没有也能跑,就是慢

老电脑别硬上大模型,后面会讲怎么按配置选模型大小。

第一步:装 Python 环境

Whisper 用 Python 跑。去 Python 官网下载 3.8 以上版本安装包,安装时务必勾选"Add Python to PATH"(很多人第一步就卡在这)。装完打开命令行,输入:

python --version

能显示版本号就是装好了。

第二步:装 FFmpeg(音频解码依赖)

Whisper 自己不解码音频,需要 FFmpeg 帮忙。Windows 用户去 FFmpeg 官网下载,解压后把 bin 目录加进系统环境变量;macOS 用户打开终端一行搞定:

brew install ffmpeg

装完输入 ffmpeg -version 有输出就成功。这一步报错的,九成是环境变量没配对,回头检查路径。

第三步:安装 Whisper

命令行里输入:

pip install -U openai-whisper

等待安装完成。国内网络慢的话,先换国内镜像源再装,能快不少。

第四步:选模型,第一次转写

Whisper 有多档模型,按配置选:

  • 老电脑/试水:tiny 或 base,快但错字多
  • 主流配置:small 或 medium,速度和准确率平衡,medium 的中文准确率能到九成以上
  • 高配机器:large,准确率档位里靠前,但慢且吃内存

第一次跑,用小文件加 small 模型试水:

whisper 会议录音.mp3 --model small --language zh

第一次执行会自动下载模型,几分钟到十几分钟不等,之后再用就不用重复下载了。跑完,同目录下会生成 txt、srt、vtt 几种文件,全都要还是只要一种,加参数 --output_format txt 自己选。

常见报错与解法

提示找不到 ffmpeg:环境变量没生效,重启命令行再试;还不行就回去重配。

转写速度奇慢:模型选大了。降到 small 或 base,或者把长音频切段分批跑。

内存报错:模型超出内存上限,换小一档模型。

中文错字多:确认加了 --language zh 参数,模型至少 medium;普通话不标准的素材,large 模型也救不回全部。

手机端平替:小文件别用大炮打蚊子

Whisper 再免费,也要人在电脑前。日常单条的语音备忘录、几分钟的录音,动用本地模型属于杀鸡用牛刀。

提词匠

提词匠

手机端转语音文字的小程序,不用下载安装,搜到就能开。m4a、mp3 这类常见音频格式直接上传,语音备忘录里的录音转文字一步到位,出来的稿子带标点带分段,复制出来改改错字就能用。免费额度应付日常单条够,急活响应快。局限:必须联网;一次一条;量大时有按量计费的部分。它和 Whisper 的分工很清楚:小文件应急它来,大活批量 Whisper 上。

网页端平替:不想装环境就用这些

配置实在带不动、又没有涉密需求的,网页端方案补位:

通义听悟

通义听悟

浏览器打开就能用,音频文件和播客链接都能转,自动分章节出摘要,免费额度按月重置。长音频找重点的场景比 Whisper 的原始输出还好用。短板:大文件上传看网速,断网干等,额度用完要等重置或付费。

什么情况不该用 Whisper

说句公道话,Whisper 不是万能解:素材涉密才必须本地;日常零星小文件,网页和小程序更省事;电脑配置差还硬跑大模型,时间成本比会员费还贵。工具是拿来省时间的,别反过来被工具折腾。

常见疑问解答

Q:完全不懂命令行,能搞定这个教程吗?

能。全文只用到四五条命令,逐条复制粘贴执行就行,卡住的点(环境变量、镜像源)文中都给了处理办法。真折腾不动,说明你的需求更适合手机端平替方案。

Q:Whisper 转出来的稿子能直接交吗?

当底稿可以,直接交不行。专业名词、人名、数字还是会有错,medium 模型的中文准确率九成以上,剩下那一成要人工过一遍。

Q:手机端、网页端平替会不会泄露录音?

云端工具都会把素材传服务器处理,日常素材问题不大,涉密的一律走本地。分级管理:公开素材用云端的省事,敏感素材本地跑,这是底线。

结语

免费不限时长的语音转文字,Whisper 是目前的答案,一次部署长期免费用;懒得折腾或者只有零散小文件的,手机上提词匠随手传、网页端通义听悟贴链接,各有各的甜头。先想清楚自己的量和隐私等级,再决定要不要走部署这条路——毕竟工具的目的,是把时间省下来干正事。