Buzz 离线语音转文字实战:从会议录音到批量字幕,一次跑通 📅 发布时间:2026/9/6 20:06:02 👁 浏览次数: Buzz 离线语音转文字实战从会议录音到批量字幕一次跑通【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz散会后你打开那份两小时的会议录音发现还是得逐句听、逐句敲字外语播客里想摘几句金句只能反复暂停打字视频剪到一半云端字幕服务又超时了。这三件事的共同解法其实是同一个Buzz一个跑在你自己电脑上的离线语音转文字工具底层用 OpenAI 的 Whisper 模型整段音频只在你硬盘上处理完没有上传环节也就没有断网、排队和按分钟计费的问题。它覆盖 99 种语言纯 CPU 就能转有 NVIDIA 显卡还能再快一个数量级。装好 Buzz顺手跑通第一条转录三个平台各一条命令系统推荐方式命令Windowswinget 包管理器winget install ChidiWilliams.BuzzmacOSHomebrewbrew install --cask buzzLinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzzWindows 用户注意安装包没有做代码签名装的时候会弹安全警告点更多信息→仍要运行即可源码公开可查。不想用命令行的也可以从项目发布页直接下对应平台的安装包。注意装完后在终端敲一条buzz就能启动主界面。想试未发布的最新版把仓库克隆下来https://gitcode.com/GitHub_Trending/buz/buzz按 README 装好依赖运行即可。最小可行流程五步出稿导入文件菜单栏文件 → 导入媒体文件Ctrl/Cmd OMP3、WAV、MP4、MOV 都行解码交给它内置的音频处理。选参数Task 选 Transcribe同语言转写或 Translate to English任意语言转英文Language 知道是什么语言就手动指定——自动检测偶尔翻车手动选准确率明显更高Model 新手选base就够。点 Run任务进队列主界面显示实时进度。等状态变 Completed任务列表会记录每条任务用的模型和耗时。双击任务行进入转录查看器第一份带时间戳的文字稿就出来了。整理一场两小时会议录音改稿和调时间戳都在同一个窗口查看器左上角的视图按钮提供三种模式时间戳表格逐段校对、做字幕用、纯文本合并去时间直接粘进文档、翻译视图先执行过翻译才有内容。听到 Whisper 把人名听错了在表格里双击文本单元格直接改改动自动保存。播放用Ctrl/Cmd P当前片段起点用Ctrl/Cmd ←/→微调终点用Ctrl/Cmd Shift ←/→边听边改不用切窗口。字幕断句怪用 Resize 重组一句长话被拦腰截断、该换行的不换行是字幕最影响观感的问题。工具栏的Resize可以按标点分割、按静音间隙合并、限制单行最大长度一键把散乱的段落重组成规整字幕行。提示Resize 的重组能力依赖词级时间戳转录前记得勾上word-level timestamps否则这部分功能用不了。导出成你能用的格式导出菜单覆盖四个常用出口TXT 进文档、SRT/VTT 进剪映和 Premiere、JSON 带完整元数据给程序处理、DOCX 继续排版。导出路径和文件名模板能在偏好设置里自定义比如输入文件名转录时间一次设好以后自动套用。演讲或直播时出实时字幕边说边出字模型要换小的切到 Live Recording 标签页选麦克风、语言和模型点红色 Record文字开始逐行滚出来。注意实时转写对性能很敏感务必用 Whisper.cpp 后端配tiny或base小模型大模型跟不上语速字幕会越落越多。投到副屏或喂给 OBS点Presentation可以单独开一个演示窗口把实时字幕投到外接屏或直播间当同传字幕和提词板都行。偏好设置里再打开实时转录导出到文本文件每生成一句就追加写盘OBS 读这个文件就是现成的直播字幕流。让 Buzz 听系统声音想转播客或线上课程的声音把系统输出改道给它Windows 装 VB-CABLE系统输出设为 CABLE InputBuzz 里麦克风选 CABLE OutputmacOS 用brew install blackhole-2ch在音频 MIDI 设置里建一个多输出设备把扬声器和 BlackHole 都勾上Linux 打开pavucontrol在录制标签页把目标应用的音频重定向过去。夜里批量处理一个文件夹的音频GUI 一个个点适合零散文件文件一多就该让buzz add上工了——它一次可以接多个文件buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp3 会议录音.wav这条命令用 Whisper.cpp 的 small 模型转录两个文件直接落出 SRT 和 VTT 字幕。再常用的参数--language zh指定语言--prompt传提示词把人名、产品名写进去错字肉眼可见地少--task translate则整条流水线变成翻译。把这条命令挂到系统定时任务里夜里跑完一个文件夹早上起来直接收稿。模型、参数和硬件一张表选完档位适合场景预期tiny/base低配电脑、实时录音、只看大意秒级出结果small日常转录甜点区速度与准确率最均衡多数人选它medium/large重口音、术语密集的专业录音有 GPU 才建议上CUDA 开好后 large 的耗时能从小时级压到分钟级省内存就选 Whisper.cpp 的量化版比如q_5用一点点精度换速度和显存的大幅改善。模型都在偏好设置 → Models管理左边已下载、右边待下载勾选后点 Download也能粘贴自定义下载地址。NVIDIA 用户记得在偏好设置里把 CUDA 选项打开反过来想彻底排除显卡干扰时设BUZZ_FORCE_CPUtrue强制纯 CPU。排错速查表中文被听岔→ 自动检测误判了语言 → 手动把 Language 选成zh。实时字幕越滚越慢→ 实时模式用了大模型 → 换 Whisper.cpp 后端加tiny/base。字幕断句不自然→ 转录时没开词级时间戳Resize 的重组用不了 → 重新转录并勾上 word-level timestamps。GPU 没生效→ 驱动没装好或 CUDA 没启用 → 确认偏好设置里 CUDA 可勾选排除法可用BUZZ_FORCE_CPUtrue。模型下载龟速→ 走的默认 Hugging Face 源 → 设环境变量HF_ENDPOINThttps://hf-mirror.com换国内镜像。把声音变成你自己的文字资产回到开头那三个场景两小时的会议录音、反复暂停的外语播客、等着配字幕的视频——现在都有同一条出路本地跑 Whisper转出来的文字可搜索、可编辑、可导出素材从头到尾没离开过你的机器。下一步很具体今天装好 Buzz把手头最需要整理的那段录音拖进去点 Run跑完导出个 SRT你就把听完变成了拥有。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考