VoiceStudio听写组件全攻略:全系统实时语音转文字3步上手

VoiceStudio听写组件全攻略:全系统实时语音转文字3步上手 VoiceStudio听写组件全攻略全系统实时语音转文字3步上手【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudioVoiceStudio 是一款开源、完全本地运行的语音工作室它的听写组件Dictation是其中的明星功能按一个全局快捷键边说边出字转写结果还能自动插入到当前正在使用的任何软件里——全程语音转文字均在本地完成不上传云端macOS、Windows、Linux 全平台支持。本指南将带你用最短路径跑通实时语音转文字。一、3步开启全系统听写整个流程只有三步全程无需写代码。第1步安装听写模型打开应用内的模型目录Model Catalogue在 ASR 标签页选择听写模型并下载。Whisper Tiny 是官方推荐的默认选择仅 0.104 GB自动检测 90 种语言。第2步设置全局快捷键进入设置 → Hotkey快捷键页签设置你的听写触发键并选择触发方式Hold按住说话按键期间录音松开即转写适合短句速记Toggle切换按一下开始再按一下结束适合长段口述。快捷键绑定逻辑在 dictation_shortcut.rs 中实现支持自定义组合键、保存后即时生效。第3步说然后看文字出现把光标停在任意文本框文档、聊天框、代码编辑器按下快捷键开始说话。底部会出现一个不抢焦点的浮动录音气泡实时滚动显示正在识别的文字再次按键结束后转写结果自动插入光标处。二、听写组件浮动录音气泡能做什么浮动录音气泡由 CaptureWidget.jsx 实现它有三个核心按钮按钮作用⏸ 暂停 / 继续暂停时静音麦克风并冻结计时恢复后继续同一会话⏹ 停止结束录音并立即转写✕ 关闭取消本次录音释放麦克风气泡下方会显示多行实时预览文本且气泡永远不需要键盘焦点——你不用切窗口它也不会干扰你正在编辑的内容。三、转写结果去哪了全平台自动插入机制这是 VoiceStudio 听写与普通录音转文字工具最大的区别它知道你是在哪个应用里按的快捷键并尽量把文字精确插回那个位置。平台自动插入行为macOS重新激活捕获的应用并发送 Cmd-V需辅助功能权限否则保留在剪贴板Windows校验窗口后激活并发送 Ctrl-V被系统拒绝则保留在剪贴板Linux X11通过 EWMH 重新激活窗口后发送 Ctrl-VWayland安全默认结果保持完整复制状态手动粘贴浏览器模式复制结果浏览器无法定向插入桌面应用界面会明确提示结果状态Inserted表示已成功插入目标应用Copied表示自动插入不可用、完整文本已就绪等待你手动粘贴。剪贴板还有快照保护——转写过程中你复制的内容不会被覆盖。详细机制可参考官方文档docs/features/dictation.md。四、听写模型怎么选7款模型对比Sherpa-ONNX 是 VoiceStudio 的听写专用引擎源码见 sherpa_dictation.py纯 CPU 即可实时运行三平台表现完全一致。模型一览模型类型语言大小sherpa-whisper-tiny⭐推荐离线90 种自动检测0.104 GBsherpa-parakeet-tdt-v3离线25 种欧洲语言0.67 GBsherpa-parakeet-tdt-v2离线英语0.66 GBsherpa-zipformer-bilingual-zh-en流式中英双语0.20 GBsherpa-paraformer-bilingual-zh-en流式中英双语0.24 GBsherpa-zipformer-en-20m流式英语0.044 GBsherpa-zipformer-zh-14m流式中文0.025 GB选择建议中文英语用户选zipformer-bilingual-zh-en只说中文且追求极致轻量选zipformer-zh-14m25 MB多语言混杂场景用默认的 Whisper Tiny。流式streaming模型边说边出字延迟最低离线offline模型准确率更高。完整文档见 sherpa-onnx-asr.md。五、进阶设置让转写更干净LLM 智能润色在设置中开启可选的本地 LLM 清理自动删除嗯、啊等口头语和口误并保留专业术语。设置面板示例如下后台预热识别器会在后台预先加载首次听写无需等待 1.3~2.5 秒的模型启动时间。静音自动降级如果某个模型连续把有声语音识别为空系统会自动用已安装的其他模型复核并降级该模型——全程不会触发任何下载。Transcriptions 页面内置开始听写按钮与录音上传历史转写支持搜索、导出、复制和一键删除详见 electron-transcriptions.md。六、适合谁用✍️写作者 / 邮件重度用户全系统任意输入框边说边写语音转文字零切换成本‍开发者终端、IDE 里口述备注与提交信息本地处理不泄露代码内容️会议与口述笔记Toggle 模式长段口述LLM 清理后得到干净的纪要。所有识别都发生在你的机器上——对于隐私敏感场景这是云端语音转文字服务无法替代的优势。现在打开模型目录装好 Whisper Tiny按下快捷键说出你的第一句话吧。【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考