Sherpa-onnx v1.10.45 发布:FireRedAsr 语音识别模型一次打通 10 种语言,附两项稳定性修复 📅 发布时间:2026/9/12 11:31:42 👁 浏览次数: Sherpa-onnx v1.10.45 发布FireRedAsr 语音识别模型一次打通 10 种语言附两项稳定性修复【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx如果你一直在找一套能离线跑起来的 ONNX 语音识别模型Sherpa-onnx v1.10.45 值得花两分钟了解一下这个版本把 FireRedAsr 语音识别模型完整接了进来API 一口气铺到 10 种语言和平台同时顺手修掉了两个隐蔽的坑。 版本速览10 秒看清改了什么项目内容版本号v1.10.45发布日期2025 年 2 月据版本时间线推断新增模型FireRedAsrAED 注意力式端到端 ONNX 语音识别模型提供 int8 量化版中英双语主要修复项① Go 绑定“实例创建成功但实际不可用”的 bug ② RTF 实时因子计算笔误影响范围C 核心、全部语言绑定、性能指标统计 FireRedAsr 模型能力拆解AED 端到端和传统流水线差在哪FireRedAsr 是 AEDattention encoder-decoder架构编码器把一整段音频压成语义表示解码器再基于注意力机制逐字生成文本。打个比方传统流水线像接力赛声学模型、对齐模块、语言模型依次交接棒每一棒都可能丢分AED 则是一个模型从头跑到尾交接少、误差积累也少。这个项目给出的 FireRedAsr large 中英版本是 int8 量化后的 ONNX 文件encoder decoder 词表资源受限的设备上也能跑出可接受的速度。它支持中文、英文样本中还包含四川、天津、河南等地域口音的测试音频对口语化场景友好。要注意边界该模型是离线非流式的拿到完整音频段才输出结果适合文件转写、VAD 切段识别、字幕生成如果你要边说边出字它不是当前版本的答案。多语言 API 覆盖矩阵语言 / 平台支持状态示例入口C✅cxx-api-examples/fire-red-asr-cxx-api.ccC API✅c-api-examples/fire-red-asr-c-api.cPython✅python-api-examples/offline-fire-red-asr-decode-files.pyJava / KotlinAndroid✅java-api-examples/NonStreamingDecodeFileFireRedAsr.javaSwiftiOS / macOS✅swift-api-examples/fire-red-asr.swiftJavaScriptNode.js✅nodejs-examples/test-offline-fire-red-asr.jsJavaScriptWebAssembly✅wasm/C#.NET✅dotnet-examples/DartFlutter✅dart-api-examples/non-streaming-asr/Go✅go-api-examples/non-streaming-decode-files/Pascal✅pascal-api-examples/non-streaming-asr/跨平台语音推理是这个项目的老传统而这次对 WebAssembly 语音识别的支持意味着浏览器端也能跑同一个模型。项目自带的 Web 示例页面支持上传文件或实时录音可以直接体验识别效果 稳定性修复与指标校准Go 绑定实例“幽灵创建”bug问题Go 接口创建识别器时底层 C 结构体初始化失败但 Go 层照样返回“创建成功”。影响识别器看起来活得好好的真正调用时崩溃或行为异常排查起来极其费时。修复效果初始化失败现在会如实抛出错误Go 用户不再遇到“创建成功、实则不可用”的隐蔽坑。RTF 实时因子笔误问题RTFreal time factor计算逻辑里有个拼写错误。影响benchmark 输出的性能数字失真拿它对比不同模型的推理速度会得出错误结论。修复效果RTF 数值恢复可信跨模型、跨设备的性能监控数据可以直接拿来用。 部署选型指南什么场景走什么集成路径你的场景推荐集成路径本地快速验证、批量转写脚本Python API直接参考 python-api-examples/offline-fire-red-asr-decode-files.py浏览器端离线语音识别WebAssembly 包模型与推理全部在浏览器内完成无需后端Android AppJava / Kotlin API 配 AAR 包iOS / macOS AppSwift API 配预编译 FrameworkC / C 桌面或服务器CXX API 或 C API搭配 int8 量化模型.NET 桌面应用C# APIFlutter 跨端应用Dart API先切段再识别VAD 模块按静音切出语音段逐段送入 FireRedAsr 离线解码给不同角色的一句话建议新手从 Python 起步示例文件里模型路径、参数顺序、结果输出都写好了照着替换模型目录即可。性能敏感用户直接用 C / C API并选 int8 量化模型速度和内存都会更好看。Web 开发者WebAssembly 语音识别让你不用部署后端一个静态页面就能交付离线识别功能。⚖️ 该不该升级版本价值判断如果你在用 Sherpa-onnx 做离线语音识别或者维护 Go 绑定v1.10.45 值得升级一个中英可用的新识别模型加两个排雷式修复升级成本几乎为零。接下来值得盯的是 FireRedAsr 的 CTC 变体与流式支持的后续落地——那会让它从“文件转写”走向“实时转写”。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考