免费又安全的本地视频字幕提取工具:3分钟把视频硬字幕一键转成SRT文件

免费又安全的本地视频字幕提取工具:3分钟把视频硬字幕一键转成SRT文件

免费又安全的本地视频字幕提取工具:3分钟把视频硬字幕一键转成SRT文件

【免费下载链接】video-subtitle-extractor视频硬字幕提取,生成srt文件。无需申请第三方API,本地实现文本识别。基于深度学习的视频字幕提取框架,包含字幕区域检测、字幕内容提取。A GUI tool for extracting hard-coded subtitle (hardsub) from videos and generating srt files.项目地址: https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor

剪好的视频需要配字幕,外语电影想复刻台词,网课课件要转成文字——这时候你需要一台可靠的"本地视频字幕提取"机器。Video-subtitle-extractor(简称 VSE)就是答案:免费开源、全程本地运行、不上传任何数据,三分钟就能把视频里的硬字幕一键转成 SRT 文件。

凌晨一点,剪辑师老周还坐在工位前。客户明天早上就要成片,一段 40 分钟的口播视频,字幕框里却还是一片空白。手动打字?四五个小时起步。用在线工具?要等、要收费,还得把素材裸奔交给别人的服务器。语音转写?背景音乐和笑声一响,转出来的文字根本没法用。

老周真正需要的,是把视频里"已经烧录在画面上的硬字幕"直接读出来——这件事,VSE 替他做到了。

与其手动抄字幕,不如让工具读懂画面

回忆一下你上次给视频配字幕的经历:播放器暂停、切到文本编辑器、打字、再切回去……一集 20 分钟的剧,光字幕就能耗掉你一整晚。更别提外语视频,听不懂的内容,想抄都无从下手。

这就是硬字幕的尴尬:它明明写在你眼前,却永远"复制"不出来。手动转录慢、准确率看运气;在线工具要上传视频,等于把素材交给第三方;而 VSE 的思路完全不同——它把"看字幕"这件事交给深度学习模型,在你自己的电脑上完成从检测到识别的全部工序,本地字幕提取全程不联网、不泄露。

VSE 能力速览:一屏看懂它能替你做什么

用四张"速览卡"讲清它的本事:

  • 🔒 字幕提取隐私安全第一:完全本地处理,OCR 识别不依赖任何第三方 API,视频文件不出你的电脑,敏感内容也敢放心处理。
  • 🌍 87 种语言覆盖:中英日韩、繁简中文、阿拉伯语、俄语、西语、法语……识别模型就放在backend/models/V5/目录下,开箱即用。
  • ⚡ 三档识别模式自由切换:快速 / 自动 / 精准按需选择,配合 GPU 加速字幕识别,处理速度最高可提升 5-10 倍。
  • 🧩 批量任务 + 智能文本替换:一次导入多个视频统一处理;编辑typoMap.json即可修错字、去水印、统一术语。

作为一款免费本地字幕提取工具,VSE 采用 Apache 2.0 开源协议,支持 Windows / macOS / Linux 三大平台,没有任何功能阉割或隐藏收费。

从零到一:四步完成本地字幕提取的完整流程

新手照做即可成功,全程不需要懂任何算法。

第一步:把源码请回家

打开终端,执行克隆命令,网络通畅的话十几秒就能下载完:

git clone https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor

第二步:给 Python 建一个"隔离房间"

项目需要 Python 3.12 及以上版本。为避免依赖互相打架,推荐用虚拟环境安装:

python -m venv videoEnv # Windows 激活 videoEnv\Scripts\activate # macOS / Linux 激活 source videoEnv/bin/activate

第三步:按硬件选对安装方式(速查表)

这一步直接决定"快不快",照着表格抄作业即可:

你的电脑安装方式效果
NVIDIA 显卡pip install paddlepaddle-gpu==3.3.1(匹配对应 CUDA 版本)GPU 加速字幕识别,速度最快、准确率最高
AMD / Intel 显卡(Windows)pip install paddlepaddle==3.3.1后补装requirements_directml.txt借 DirectML 吃满显卡算力
无 GPU / 普通笔记本pip install paddlepaddle==3.3.1CPU 也能跑,只是速度慢一些

无论哪种方式,最后都要执行一次pip install -r requirements.txt安装基础依赖。

第四步:框选字幕区域,一键运行

启动图形界面:

python gui.py

界面布局很直观,核心就三步操作:

  1. 打开视频:点【打开】选择文件,可以多选实现批量提取;
  2. 框选字幕区:在预览区拖出一个矩形框,把字幕出现的区域圈起来,软件之后只认这一块;
  3. 点【运行】:剩下的全部交给程序——检测关键帧、定位字幕位置、OCR 识别文本、过滤重复行,最后自动生成 SRT / TXT 字幕文件。

右侧参数面板还能按需调整:界面语言、视频字幕语言(87 种可选)、识别模式、硬件加速开关,以及"生成 TXT 文本字幕""重新分词"等选项,全部可视化勾选,零学习成本。

三类人的真实用法:VSE 在他们手里的样子

自媒体博主阿May:每天要更新两三条视频,字幕以前全靠外包。现在她把素材批量拖进去、统一框选字幕区、开启硬件加速,一条 10 分钟的视频从手工转录的 40 分钟压缩到 3 分钟——晚上导素材,早上起来字幕文件已经躺在文件夹里。

日语学习者小哲:追剧时把字幕框拖到屏幕下方四分之一处,选日语识别模型,导出 TXT 文本后导入背单词工具做成学习卡片,一边看剧一边积累生词,听力训练不再"听过就忘"。

网课老师王老师:把课程录像批量转成 SRT 字幕,配合剪辑软件二次加工课件;同时在typoMap.json里把学科术语统一成规范写法,出片质量稳定又省心。

避坑指南与提速清单:常见疑虑一次说清

Q1:识别准确率不够高怎么办?

先检查字幕框是否框准、语言是否选对,再考虑升级识别模式。三档模式的取舍如下:

识别模式硬件要求速度准确率适合谁
快速有 / 无 GPU极快85%-90%追求效率、要求不高的日常素材
自动有 GPU90%-95%日常首选,兼顾速度与质量
精准有 / 无 GPU95%-98%丢字幕轴、错字较多时的兜底方案

Q2:处理速度太慢怎么优化?

开启硬件加速(NVIDIA 用户装好对应 CUDA / cuDNN);切换快速模式;处理前关闭占内存的程序,至少留出 8GB 可用内存;把视频文件放到 SSD 上也能明显提速。

Q3:软件启动不了或跑不出结果?

依次排查:Python 是否为 3.12+;依赖是否装全(重跑requirements.txt);backend/models/下的模型文件是否完整;最后是最高频的坑——程序和视频的存放路径不要带中文和空格,否则可能出现未知错误。

Q4:批量处理时报错?

批量提取时保证所有视频分辨率一致、字幕区域保持一致,整批任务就能顺畅跑完。

再进一步:替换文本、多语言与命令行自动化

VSE 不止"提取"这么简单,进阶玩法同样值得一试。

智能文本替换:编辑backend/configs/typoMap.json,可以自动修正 OCR 常见误识别(比如把 "l'm" 修正为 "I'm")、抹掉视频水印和台标、统一专业术语,甚至过滤掉不想出现的文案:

{ "l'm": "I'm", "Let'sqo": "Let's go", "威筋": "威胁", "台标水印文字": "" }

多语言字幕:同一视频可以分别用不同语言模型提取,再配合字幕编辑软件微调时间轴,轻松做出双语学习素材。

命令行自动化:不想要图形界面时,运行python ./backend/main.py即可走 CLI 流程,方便接入批处理脚本和定时任务。

补一句"内行视角":VSE 的能力来自backend/tools/下的几个核心模块——字幕检测(subtitle_detect.py)、OCR 识别(ocr.py)、硬件加速(hardware_accelerator.py)和文本后处理(reformat.py),想深入研究的开发者可以直接啃源码。

现在,给你的下一个视频配上字幕

从手动逐帧抄写,到一键本地提取,VSE 把"字幕"这件事的成本压到了近乎为零:免费、开源、隐私安全、上手只要三分钟。无论你是每天赶稿的自媒体人、啃外语的学习者,还是批量出课件的老师,它都值得出现在你的工具箱里。

克隆源码、装好依赖、拖入视频、框选字幕区、点击运行——今晚就用它,把积压的视频全部变成可编辑的 SRT 文件。

【免费下载链接】video-subtitle-extractor视频硬字幕提取,生成srt文件。无需申请第三方API,本地实现文本识别。基于深度学习的视频字幕提取框架,包含字幕区域检测、字幕内容提取。A GUI tool for extracting hard-coded subtitle (hardsub) from videos and generating srt files.项目地址: https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考